{"as_of":"2026-08-21T12:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ca9b36733354657b80924ccea0123e7683886a5905024b154c63366c2d6a80d","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:00:31.793739Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09615/citation-record","integrity":"/paper/2507.09615/integrity","json":"/paper/2507.09615/citation-record.json","paper":"/paper/2507.09615"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:00:31.578274Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.578274Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:bc31c5ea7a5e3dd43657dcc2f03786b51f6bba159d908794b42242eff284ea77","observation_id":"79e205f0-ecce-4568-890a-16885b5f701d","resolution":{"observed_at":"2026-08-06T18:00:31.578274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.582097Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.582097Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:c3465789e8ccd9f4d039bb5180a1228c7c90ae2886fe628969df502c07df1ae8","observation_id":"7b1fdebe-9eaa-493a-b054-f104ddbdb6d5","resolution":{"observed_at":"2026-08-06T18:00:31.582097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:48.129354Z","title":"Dpa: Dual prototypes alignment for unsupervised adaptation of vision-language models","venue":null,"work_id":"3ddb921d-c6bf-4576-9a93-83bd039dcc16","year":2025},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.585637Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:fb9dc0d6af001a88c52d4c3fa3937fa9957027069133203ad5a7c3b6c5cf90e1","observation_id":"6a5415d6-04ea-45ee-8119-866eb49c6b1d","resolution":{"observed_at":"2026-08-06T18:00:48.132976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T18:00:31.590153Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.590153Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:0e967f3c2b065b87e73543a22387ec9d94a6e74bab5844e42793d524d4d388f5","observation_id":"cbd47111-fbb9-4fdb-8833-42cbeed3568d","resolution":{"observed_at":"2026-08-06T18:00:31.590153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:48.058783Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":"4dc3505e-318d-4360-beef-7a3e54811502","year":2014},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.593840Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:4bc35d53e94e82781a56fa104c3785b1aa3acd86e05fb164a0795e11f7393242","observation_id":"a5512491-c663-4db5-ae11-20dedcfaf51f","resolution":{"observed_at":"2026-08-06T18:00:48.114909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.597300Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.597300Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:2f17aee1a8ee0fe767be896ae72eb4de66be700981fc74667de0ca29c8746b15","observation_id":"ace2ce56-843d-440d-b772-84807d0caf1e","resolution":{"observed_at":"2026-08-06T18:00:31.597300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:47.586545Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"17cfd81c-fd3c-415a-9f5f-af5c1dd8a41c","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.600420Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:15cf9de498d5859d4f6c48e660c4df3f5b0de8931f1f5797e1750e4df6b3124d","observation_id":"ed33b855-a438-4791-98d6-ce15d6803ed2","resolution":{"observed_at":"2026-08-06T18:00:47.971557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:40.555024Z","title":"Remote sens- ing image scene classification: Benchmark and state of the art","venue":null,"work_id":"2c2e6ea4-48b5-43ef-9196-1cb8b788085e","year":2017},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.603507Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:6f30ab1dcfe9e2ed9a62dd2ee87e84ad28063b85c11e9db6d7b9105f29a242f1","observation_id":"485d8ceb-e661-4dd2-bc57-357f0385a646","resolution":{"observed_at":"2026-08-06T18:00:41.128504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:39.475883Z","title":"Distribution-aware prompt tuning for vision-language mod- els","venue":null,"work_id":"932a5508-64ec-429e-bac6-a05769da4da5","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.606726Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:e4a67183c8fbfee3c3638fe4eab7b265dff5b8319f3cd7c128374ba6ea8da727","observation_id":"92de0686-018a-4a4d-84fe-68d94dce94cb","resolution":{"observed_at":"2026-08-06T18:00:40.021432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:37.967783Z","title":"Describing textures in the wild","venue":null,"work_id":"f598ff28-e222-4e94-8738-52c051cf9f87","year":2014},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.610582Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:27d64cfcdf10d4c33280d3bcb610cb8b59c2130faa33279b170d4d7ab52b4ed6","observation_id":"979bc9d2-d280-441d-82f4-54cb061b8e2a","resolution":{"observed_at":"2026-08-06T18:00:39.076639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:37.377851Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":"8b5a65af-2150-4b6f-a75e-27676da83473","year":2020},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.613881Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:e7dcc45750a11d5093ad8828ca6debd54daddf4173cad8cc9b631dab210ad2f7","observation_id":"394e09b0-237e-4daf-9234-c31d5cbc7a95","resolution":{"observed_at":"2026-08-06T18:00:37.621766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.617017Z","title":"Improving clip training with language rewrites","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.617017Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ce610cd3d1ac1fccb9a2aba2b967aa7e8383bdc50263cc5126595873decea5ff","observation_id":"656a29f7-b13f-4c54-b155-8ca53831e369","resolution":{"observed_at":"2026-08-06T18:00:31.617017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.620299Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.620299Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:c50261ce15f5f863f4ebf34d7e202860b0988b3937803791b2a5400b1ec8ee0d","observation_id":"0f95cd84-16d6-4d58-8193-fa8802a1c336","resolution":{"observed_at":"2026-08-06T18:00:31.620299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:37.044420Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":"0a99194d-3740-4ed1-a366-b20dc3933bb9","year":2020},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.623602Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ae38b181983d57c0f7045aa981dcd2d929211534198fbea97d442ed3da1bbefc","observation_id":"65913c6e-e78a-4af6-96ef-91f519c03ee8","resolution":{"observed_at":"2026-08-06T18:00:37.162329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:36.795849Z","title":"Perceptron-based learning algo- rithms","venue":null,"work_id":"f278d452-c67b-489c-96cf-3672620300e9","year":1990},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.626521Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a584557191893f95bd7c269f93c1be4a4a83c9f71cc6e2dbbc74d8bec7c67fc8","observation_id":"70e8545d-9d3f-4954-8284-2763ee765e32","resolution":{"observed_at":"2026-08-06T18:00:36.922923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:36.599524Z","title":null,"venue":null,"work_id":"ab5acb5d-fb0b-4640-8f87-00f03d9752ee","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.629523Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a3ad179d4933a265c2587c623a3810373cf02818012376cf6adf1fe3e3ba05c5","observation_id":"79fed6b7-45ae-4068-a4ec-3f41f18ce05d","resolution":{"observed_at":"2026-08-06T18:00:36.697822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:36.137367Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"9da68288-375a-489b-a2f9-9de3e758c657","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.632814Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:cd37562df1f733033817e9cf6de286ae87548a00dd5b2d6db771f4864f11151d","observation_id":"f7c32b89-cd12-43fa-b1d7-32e9e4ea1092","resolution":{"observed_at":"2026-08-06T18:00:36.445314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:35.364730Z","title":"Parameter-efficient model adaptation for vision transformers","venue":null,"work_id":"001f45d0-38a2-4a96-b892-46a5d94f6aa4","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.636225Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:6aba792a05766dd8dbcb2b64d96846ea50bb354127028875cc9218b636002267","observation_id":"180fed66-0730-4a74-be02-6688e6159f84","resolution":{"observed_at":"2026-08-06T18:00:35.801606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:34.479601Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"1dd95cff-fc1a-4627-870b-cecf19428ff2","year":2019},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.639317Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:7de7069cf38fe9553093453a2a0bd8ccc0149e09303158000c84001f3605a7b9","observation_id":"d048d510-6bd8-4160-81f9-df2b6e03d7f2","resolution":{"observed_at":"2026-08-06T18:00:34.909999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.862832Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"e1df650c-6b18-4b93-9685-00c0e4fb0c4f","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.642414Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:3e6ea872dc58108268244da5c751dc3ff26d359eaacac859382f6f7a29fd5c46","observation_id":"1791a035-7e8b-4c1e-b104-74c4cb178305","resolution":{"observed_at":"2026-08-06T18:00:34.078815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.538094Z","title":"Reclip: Refine contrastive language image pre-training with source free domain adaptation","venue":null,"work_id":"3b64ea41-3d06-4bb3-858a-7a36a20d3b0d","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.645861Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:37ed17de868f3a0fc3e4c7deeb8b03c493b57532ea8173f03e8668851c0dadcd","observation_id":"7b719fc3-c289-45c4-b065-2079ba40adf1","resolution":{"observed_at":"2026-08-06T18:00:33.659160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.367141Z","title":null,"venue":null,"work_id":"59aecc1d-8d2d-441a-aca0-894bfc2b415b","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.649283Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ee799f8413d34fc9ee945a5d12a81fcadc9e051d97e080f4d208099080141142","observation_id":"fe4deb7d-5b2d-432e-b098-eb343015940b","resolution":{"observed_at":"2026-08-06T18:00:33.480601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.240253Z","title":null,"venue":null,"work_id":"c77a246e-4f08-4880-b9db-88ef6a7af45f","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.652124Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:40d6407b477ed33a07ac16326e10bb2bc411a1bed82a99694335286995e7583f","observation_id":"56e7a5d4-43be-4891-b553-0aea7b719fe3","resolution":{"observed_at":"2026-08-06T18:00:33.310928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:33.082011Z","title":"Adapting visual-language models for generalizable anomaly detection in medical im- ages","venue":null,"work_id":"3ae1c7dc-9296-46e4-823f-206ef22e713a","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.655641Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:1bc1c2872808d99926106b7ccf52b6b58b3cf6a3094a1c9f6710d1451bb37e72","observation_id":"982c8e1c-d73d-4bad-97d6-b0c96d50782a","resolution":{"observed_at":"2026-08-06T18:00:33.150754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03649","last_updated":"2022-08-22T08:45:33Z","snapshot_observed_at":"2026-08-16T17:08:29.314804Z","submitted_at":"2022-04-07T17:59:57Z","title":"Unsupervised Prompt Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03649","snapshot_observed_at":"2026-08-06T18:00:31.658407Z","title":"Unsupervised prompt learning for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.658407Z"},"links":{"cited_paper":"/paper/2204.03649","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:3809e82ec2366fd1bf782b970912b29eafb28dd7a84ae61d92944b3b1fb740ab","observation_id":"e5ba3e4d-2e7e-4bf6-bda4-1ead158abbc5","resolution":{"observed_at":"2026-08-06T18:00:31.658407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.929180Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"874e476a-adf3-4384-8ee4-2cec4d1a586a","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.661594Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:1f69ee0804227041161f4e4c78114fff1b68edc1d452e3ced997c2084bbc72d7","observation_id":"a8602394-960a-46ab-b943-75eab1bb27e4","resolution":{"observed_at":"2026-08-06T18:00:32.963582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.756692Z","title":"Learning to prompt with text only supervision for vision- language models","venue":null,"work_id":"8214eb3c-f2fa-49b4-b3df-94ebde15d611","year":2025},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.664429Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:abf72fa33ebfb2ecc94175611c9204faecac268983ef3f376a2822a643251566","observation_id":"3bc2c75e-43fc-4222-b5cc-4ff9bf067757","resolution":{"observed_at":"2026-08-06T18:00:32.856613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.638635Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"57afe1e0-3872-4a88-86f1-5eac80403006","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.668129Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:44aa1b64a36ed35d8a86f8268fc6bdc352e5bfd431ab6ffdb05e46b24907108d","observation_id":"74cbbb46-ca1f-49a6-9a47-751acf0b59ee","resolution":{"observed_at":"2026-08-06T18:00:32.717699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.514256Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"d3e5b0ae-8f8f-4198-805c-20148e5ad071","year":2013},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.671469Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:e6b2dc1e3c7996cb5b4a67c894e069ab32d9ba026a9e68572987c8779f75f205","observation_id":"41bc28ee-386e-41c1-adfa-de32a484d263","resolution":{"observed_at":"2026-08-06T18:00:32.581788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.674245Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.674245Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:845c229865e57cac54ba6a4c47ad37270a4a1125566e46d8bfd1e1b04e405db4","observation_id":"6e63a22f-ad22-48f0-9b0a-38b2e67e4813","resolution":{"observed_at":"2026-08-06T18:00:31.674245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.440378Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":"2311780f-c203-461f-8585-e6a02491f7dc","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.677141Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a2f236f9cf6b190b878f878a2e60203436969248a5f231f6c9b29da60f6fda2e","observation_id":"d8a1f0da-c252-49c3-b750-fac5561df7fe","resolution":{"observed_at":"2026-08-06T18:00:32.458270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.679900Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.679900Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:961819ca3c939c25245c5e9342edce7e8b9d28239befbd5872d893b1c5563766","observation_id":"73579cf1-fa10-4bef-82b2-bd71be44c17f","resolution":{"observed_at":"2026-08-06T18:00:31.679900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.403506Z","title":"Visual-text cross alignment: Refining the similarity score in vision-language models","venue":null,"work_id":"cee94d32-5d06-4bbd-9faa-3eb4c9c6747e","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.682743Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:9b3f0b8f3d7ac058b3814e8348e60883563caa8cd6088b1c46b5feec2fcda765","observation_id":"8faac6ef-67fe-46d0-beed-8d8329a52c20","resolution":{"observed_at":"2026-08-06T18:00:32.419435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.366884Z","title":"Masked unsupervised self-training for label-free image classifica- tion","venue":null,"work_id":"a7841cf8-4d36-4798-b16f-4b2b3b29dddb","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.685585Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:1833b1157d0495d90bbac6a6850b92750448659e6afadf47409b525e31019e4c","observation_id":"ed775e83-1abe-4f8a-bf21-b4af6b0d760e","resolution":{"observed_at":"2026-08-06T18:00:32.383725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.689196Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.689196Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:bdd2492ecb7092feb018213bdb28581b43578805c295a5782ba45a70784f94d2","observation_id":"7b0b31b6-7410-402c-b8b8-759db0e3a227","resolution":{"observed_at":"2026-08-06T18:00:31.689196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.328539Z","title":"Promptkd: Unsupervised prompt distillation for vision-language models","venue":null,"work_id":"a8e49ad8-cdb5-441b-9e2d-96ff7bbc1cf1","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.692163Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:f5b79d3334ddf6dbace92c5ffef709854de711988feec5f56c3e27647c4a6ba9","observation_id":"ee1ea375-1198-4e30-b99b-9fb98566ba80","resolution":{"observed_at":"2026-08-06T18:00:32.343106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.295122Z","title":"Clip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation","venue":null,"work_id":"93399390-0b75-4575-8c17-d606183c576e","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.695185Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:66e4381bf75a456c59537735ee22cc57ba187df9d4007a5e6a01ca8a3c98e290","observation_id":"202df6ea-64c8-43f9-ac34-2dba144e4cbb","resolution":{"observed_at":"2026-08-06T18:00:32.308495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.262239Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"d6c4a2b3-36df-43be-9c74-926757a4c0de","year":2017},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.698095Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:86abe8ce0c041952d8fa9db74a2eff1dc983de55358b2ace5656e6515c927f13","observation_id":"1827d0cd-f261-4640-a897-eb088f709497","resolution":{"observed_at":"2026-08-06T18:00:32.278601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.701788Z","title":"Prompt distribution learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.701788Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:efc92fd3f26472f8d6706069fd8d397260c131dfb0d8de53ba7e41dd4e779a08","observation_id":"f32ab6fe-2a9f-49e3-a242-aa913b32d224","resolution":{"observed_at":"2026-08-06T18:00:31.701788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.224418Z","title":"Lafter: Label-free tuning of zero-shot clas- sifier using language and unlabeled image collections","venue":null,"work_id":"6e9326ce-7b75-4c30-9bf0-3a8571a76707","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.704735Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:577926bad10d0e337aee8a66fec6fbebd07e72b3daae85e162a89fb5f74167fd","observation_id":"5cc4c2a8-7367-4246-ba86-bc7f4c10fefd","resolution":{"observed_at":"2026-08-06T18:00:32.237722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.190545Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"37c0c834-432c-42b4-a51b-2e5533a0ad57","year":2008},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.708317Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:6f327455968d8302d4b07b2d660f79dcdbc8b4a16e60cdea45d3b6aa023fdfcf","observation_id":"5cfe96ac-acb1-4f57-901d-2d48338343be","resolution":{"observed_at":"2026-08-06T18:00:32.204964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.157108Z","title":"Valse: A task- independent benchmark for vision and language models cen- tered on linguistic phenomena","venue":null,"work_id":"1bb6f569-5c5a-46fb-8b44-d42675d7d859","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.711700Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:89496cb97e34066a03b21a037f59d8b8fc04d0cdf32490b52b6cf35a43b47f32","observation_id":"d10282c8-8334-4ede-bb57-6f4e2f9c17f1","resolution":{"observed_at":"2026-08-06T18:00:32.169214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.715225Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.715225Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:f32fccd901f28579be60f094dfc4e220a1584c99f65aee7117eeb65ea245d94b","observation_id":"66825e8a-9afa-4745-999d-c6d0192393ca","resolution":{"observed_at":"2026-08-06T18:00:31.715225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.123996Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":"be1bad14-0c39-4f8c-a736-2579b6938391","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.718576Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:f1eb21e2e34e4f6db0d9c536bc033e327c719d8718483d5d238f1a6251e6fa39","observation_id":"0038cdbd-f8e9-49ad-8985-3fbb38c1a255","resolution":{"observed_at":"2026-08-06T18:00:32.134732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.103859Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"107454fd-005a-4bcc-98f4-7192b596e953","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.721668Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:06eb37c4821fdcdc9867a205173d87abcb7f281e0f658cea6dc1290dd5241c2b","observation_id":"42624763-e39f-4487-9b18-9ba7fcc64e89","resolution":{"observed_at":"2026-08-06T18:00:32.109810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.062610Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"dcef7e87-4b2b-4c3e-a622-95894b98bc7a","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.724951Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:fe1267af3ee79da97b513b11ddf9697dc415aa358ae2dc49459f19ae70498f16","observation_id":"b7b611f0-c2e0-48f8-90c4-d0129691857a","resolution":{"observed_at":"2026-08-06T18:00:32.078177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.028799Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":"650134c9-9a54-4692-85a5-cc78839baec9","year":2012},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.727916Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ff7cf43c818eb7e911513721f4b9356abbb6a1b04a9eda190f6f1e872f869202","observation_id":"56e30ede-9e7a-4366-b262-cc780a661c48","resolution":{"observed_at":"2026-08-06T18:00:32.043348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.014412Z","title":"Pouf: Prompt-oriented unsupervised fine-tuning for large pre-trained models","venue":null,"work_id":"ca7e62d5-370b-482c-a2fc-fcc80ad98eda","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.730962Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:a4feb2a4a4fe58eb14c5588fe6ae904c389adda436749ee114f05141135cedfd","observation_id":"ff89abd8-f48f-4518-8880-349e63f980e7","resolution":{"observed_at":"2026-08-06T18:00:32.018115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:32.006052Z","title":"Clip the gap: A single domain generalization approach for object detection","venue":null,"work_id":"e3454aa5-2f65-4505-83da-e94d4e3b0982","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.734511Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:4ae376fb84b67024e942a1c7fd4f03394905e2d69af4f4ca7fd144a0b4031d8d","observation_id":"d0953c9e-28d4-4b8b-b18c-539778e2fc56","resolution":{"observed_at":"2026-08-06T18:00:32.009428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.997337Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"38982dc7-85c6-4950-97c6-0807a0a17be0","year":2011},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.737504Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:feeb3f4686af0d238b74dabc412f7352560ea89bbd19b96fea2c8cce144820c7","observation_id":"a694403d-ef77-4df9-8599-a5562d97768c","resolution":{"observed_at":"2026-08-06T18:00:32.000745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.988471Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":"e13590b5-8d14-489f-afd4-0e8ceb23e272","year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.740497Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:71814702ae30e45184da7ca7abc86934257672c472998f21a7d2ea20ca2d1d60","observation_id":"9735b591-1b8d-423b-a5d9-d74a508b6b3b","resolution":{"observed_at":"2026-08-06T18:00:31.991474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.979887Z","title":"Debiased learning from naturally imbalanced pseudo-labels","venue":null,"work_id":"23419d8a-3c3b-47ae-907c-f0d2cad739a4","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.743685Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:892d63058e736bb4e8dcd8ccb48f08710217ca98a9695e501cd5a6abd4d34b2c","observation_id":"15261457-3c75-4e0e-9c5a-e5b7f855b58c","resolution":{"observed_at":"2026-08-06T18:00:31.983127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.971116Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"827caa46-9e7a-4b82-80b3-7f8e564c25f7","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.746809Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:02a9f5f9e882b51adf1cce1fa320460ab600f261ee4c1b76cb39383e34189014","observation_id":"9598e3ed-8a95-473a-83e3-4fa0267077cc","resolution":{"observed_at":"2026-08-06T18:00:31.974225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.962492Z","title":"Aid: A benchmark data set for performance evaluation of aerial scene classification","venue":null,"work_id":"bbdfc0ac-d673-4bdb-831e-18aa879dfb3e","year":2017},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.749883Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:307d795015d2767d40af8762b0f93eeacd45447e0ed6b488e6e808cb3ebf5e39","observation_id":"e6e5bd0e-d4e7-4196-9e9c-a8abc1cc1428","resolution":{"observed_at":"2026-08-06T18:00:31.965642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.952097Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"28b54440-6121-4844-b827-a22cf95fb03b","year":2010},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.753154Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:d5998628fe31fadc2fded645f657e6afe2d226239980b11a833daf1b5939d93e","observation_id":"279d2b8f-d5d3-4501-9fa3-1a38e5adba0d","resolution":{"observed_at":"2026-08-06T18:00:31.955970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-17T12:17:37.741844Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-06T18:00:31.755954Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.755954Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:b4ff8486c1ba19afb01c6c1f9e49530d29f9e92f28800c624446d543cf14072d","observation_id":"5616dde8-9a62-406a-b7f2-097f2697f444","resolution":{"observed_at":"2026-08-06T18:00:31.755954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.943245Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"744e1590-62b5-49e3-b536-370f2d0417a2","year":2022},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.759535Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:d618f1ee8ee64b04952c1976563f3f22d6c9409d6d51933148e5053d2bb52205","observation_id":"98575ec9-0d5f-47d7-9047-1a5703b2179c","resolution":{"observed_at":"2026-08-06T18:00:31.946697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.934081Z","title":"Lever- aging cross-modal neighbor representation for improved clip classification","venue":null,"work_id":"ebb277eb-821f-4bc9-b248-48c257555b4e","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.762821Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:4b2a8af5fc5dd16e2e742e35e2045e341a3de9de7c952235865aa3e7b6d720ce","observation_id":"80e44ed2-8cdc-4f7d-aaf8-3bd1b58eb878","resolution":{"observed_at":"2026-08-06T18:00:31.937415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T18:00:31.766827Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.766827Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:c0715ce0e095270d3bd768c25e7c3cd79a204a4e503c2f4d5636f88f3c0b137e","observation_id":"defbc4fe-7c63-4deb-8414-e981028221de","resolution":{"observed_at":"2026-08-06T18:00:31.766827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.923563Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? In International Conference on Learning Repre- sentations, 2023","venue":null,"work_id":"66102c58-a210-4831-b340-fc9e1bdbc558","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.770741Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:5da206e686ddd17eeb8d54dcf7b9609466ba132d4cb10d6e89045d59095b634d","observation_id":"5d1c9f41-27fe-4607-abed-98fd44903b6c","resolution":{"observed_at":"2026-08-06T18:00:31.927830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.914246Z","title":"Boost- ing vision-language models with transduction","venue":null,"work_id":"fccdd52f-d602-4958-8971-e6736e501790","year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.774760Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:70967191e957e6af4138a71315f863ecd95bc8700304b94cbecaa22e4d285407","observation_id":"d70ea8bb-a120-44c6-8267-56cfe698725a","resolution":{"observed_at":"2026-08-06T18:00:31.918023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.904746Z","title":"Candidate pseudolabel learning: Enhancing vision-language models by prompt tuning with unlabeled data.International Conference on Machine Learning, 2024","venue":null,"work_id":"8250ce5e-5bb6-447e-8ce8-99da2dcfa033","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.777795Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:4c92f305848a77a3ec00834b10b60759ce5dfc907af3f25294bb209a67b37fcb","observation_id":"07062fc6-0403-4b6c-a1d8-5293407d2482","resolution":{"observed_at":"2026-08-06T18:00:31.908386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.895138Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners","venue":null,"work_id":"52bc29c9-755b-4d28-b58f-cad99f3128ac","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.780899Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:bf98a88fd7b7b8ac335a037c78b515638d5a50e4fb90f986ef3e164994d4654b","observation_id":"d1c336b6-34fc-4121-b33c-f8248c34c39e","resolution":{"observed_at":"2026-08-06T18:00:31.898969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.885216Z","title":"Mediclip: Adapting clip for few-shot medical image anomaly detection","venue":null,"work_id":"384d9029-76cc-467f-b65b-206d54c7fc4f","year":2024},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.784147Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:4ec2794c83bed0c5b6413c771ccbfbc87a1075e4fed5044c3d73d289356944ff","observation_id":"526443bb-fdc9-46f5-b5cb-5ee7bb89c047","resolution":{"observed_at":"2026-08-06T18:00:31.889355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.787539Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.787539Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:eb54af256f2fbf1e09dc5cbf6bb643ef521e445dd9f4fca04ee90b2a489992d4","observation_id":"520e91b5-7b14-4a86-93d3-508d886d42b1","resolution":{"observed_at":"2026-08-06T18:00:31.787539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.790759Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.790759Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:ea98208ba68ba65e0b07a73fc4de6f056cd7b5f23208f3d0bae59772916a2131","observation_id":"3e64f725-ad24-4d13-b39a-14f9c4e3d653","resolution":{"observed_at":"2026-08-06T18:00:31.790759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:00:31.864540Z","title":"Not all features mat- ter: Enhancing few-shot clip with adaptive prior refinement","venue":null,"work_id":"878d6152-43bd-454f-99e4-516ce3f1c899","year":2023},"citing_paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:00:31.793739Z"},"links":{"citing_paper":"/paper/2507.09615"},"observation_digest":"sha256:9b8b0e20caf6591f5badee11e7675d474b377d7fb5a4736de4f37d9d1e0913c2","observation_id":"d3b6211f-cfaf-4675-b5c0-6eab7820fc98","resolution":{"observed_at":"2026-08-06T18:00:31.869263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09615","last_updated":"2025-07-13T12:38:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:18:19.122718Z","submitted_at":"2025-07-13T12:38:38Z","title":"Towards Fine-Grained Adaptation of CLIP via a Self-Trained Alignment Score"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2507.09615."}