{"as_of":"2026-08-22T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48bb7eae81fe53e96e528fec9dc3f0cb2a3c81364e613bc9701cf4dd222b73ca","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:19:02.251395Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:32:20.408599Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:32:21.103085Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"cited_work":{"arxiv_id":"2412.20682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20682","snapshot_observed_at":"2026-08-12T00:32:21.103085Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","venue":"cs.CV","work_id":"edb2a5f8-6ba3-45f8-8cc5-f987258cdf15","year":2024},"citing_paper":{"arxiv_id":"2608.08069","last_updated":"2026-08-08T11:28:10Z","snapshot_observed_at":"2026-08-21T18:26:03.034328Z","submitted_at":"2026-08-08T11:28:10Z","title":"HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:32:20.408599Z"},"links":{"cited_paper":"/paper/2412.20682","citing_paper":"/paper/2608.08069"},"observation_digest":"sha256:b1016c546eb86400220fb11c6fdec4e9b4660af69c058e67c51526dd90a48d47","observation_id":"12f4859a-834e-4817-a2cf-bfb3385c5b4e","resolution":{"observed_at":"2026-08-12T00:32:21.110763Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20682/citation-record","integrity":"/paper/2412.20682/integrity","json":"/paper/2412.20682/citation-record.json","paper":"/paper/2412.20682"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.849653Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"3c7c7d5e-59b2-4cde-b286-8dd9b6bbaae2","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.062335Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:f20f696e95fdf69e9a7d015e7accc7a229e261b661760ea1c903e44a63a7a95f","observation_id":"c6080f1f-968c-4258-abc4-92ad33c29ca7","resolution":{"observed_at":"2026-08-10T23:19:02.853203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.840583Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":"65a3a66b-c1e3-402a-a0f0-354a27e0ca3c","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.067085Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:8cc25d983ce752ea224ed683c4e6efebab8c2e57d42496fc897d4253d8ebc63f","observation_id":"24a9c0f8-f2fe-4376-a37e-59c0a3822ab3","resolution":{"observed_at":"2026-08-10T23:19:02.844441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.833606Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"aeff6827-70ca-4da3-a83f-96a278fdb1be","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.070476Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:00e1213137e636761674edcaa5b88ea84b20b0ccdc21cd85f27192970b0accc4","observation_id":"1496bf16-a508-4a7d-9e0c-b9a0d8b127c3","resolution":{"observed_at":"2026-08-10T23:19:02.836193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.824907Z","title":"Sgva-clip: Semantic- guided visual adapting of vision-language models for few-shot image classification,","venue":null,"work_id":"9ae64090-3a53-490e-ad08-458cdd33002a","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.074512Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:7e09b19585ff77192a4a60944bb5e7fb59c5e362beac295e0ae25078eec3dcce","observation_id":"1d7dc89c-8759-4ea7-bd9f-7f6e10e24a54","resolution":{"observed_at":"2026-08-10T23:19:02.827397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.816085Z","title":"Clip-vg: Self-paced curriculum adapting of clip for visual grounding,","venue":null,"work_id":"4492f863-a3f3-4ea3-a4f0-262c20fdc2ab","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.078024Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:d12dcf905fdf705e9dfe0c9ed9d3e1a49de836d8e5772f49aabef12939e785f1","observation_id":"f125e2cf-d345-4ff8-8bf6-1d65bf841a07","resolution":{"observed_at":"2026-08-10T23:19:02.818810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.805881Z","title":"Effective end-to-end vision language pre- training with semantic visual loss,","venue":null,"work_id":"6f561e14-f784-47a4-8920-410746a54d91","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.081342Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:7876b4b64d86d3f8c40901c3a2995b9acc74eb47fab636a3ccc210eba5bbeaf3","observation_id":"4f0ff8ac-de93-4d10-bae8-4f677414e50c","resolution":{"observed_at":"2026-08-10T23:19:02.809768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.796031Z","title":"Neural logic vision language explainer,","venue":null,"work_id":"57f888d3-5ecf-473e-8aa6-79216d5c9728","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.085792Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:08086fca1158e6545995f337f65af7b87167933be5c36b5f8ef1f8be8538631d","observation_id":"39e2d1f9-77ae-45d4-8827-e40e13faa139","resolution":{"observed_at":"2026-08-10T23:19:02.799422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.785349Z","title":"Lovm: Language- only vision model selection,","venue":null,"work_id":"691004ce-3472-47f9-b420-f3955333cb0a","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.088657Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:dd9896da231a27d8224fdb0dc90080b1e44e930a9e5817dcb80f111129cb73e2","observation_id":"45f4ac16-7638-4079-96fe-a911d77bd1f4","resolution":{"observed_at":"2026-08-10T23:19:02.788305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13797","last_updated":"2025-05-18T16:13:47Z","snapshot_observed_at":"2026-08-16T14:07:56.491948Z","submitted_at":"2024-03-20T17:54:58Z","title":"Bridge the Modality and Capability Gaps in Vision-Language Model Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13797","snapshot_observed_at":"2026-08-10T23:19:02.092268Z","title":"Bridge the modality and capacity gaps in vision-language model selection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.092268Z"},"links":{"cited_paper":"/paper/2403.13797","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:63c9ffb83b23a6accc0e17c7135a74727952c42332bedef6133e70f989d217e7","observation_id":"ed98bd14-cf8f-4e55-a8c6-7b2f33da4b48","resolution":{"observed_at":"2026-08-10T23:19:02.092268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.096576Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.096576Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:7854b0530c8966489deb48836bb4812bc2ba9a962876d081655dee1a207d8469","observation_id":"a9663b70-939f-42e3-b691-b47a749e5d47","resolution":{"observed_at":"2026-08-10T23:19:02.096576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T23:19:02.099108Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.099108Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:742a816e98146e2aecd34949bd111d370f4deb03d008ab530ee742a9a54bdaf1","observation_id":"59c80df0-e92e-4a65-bf70-fb67a9d8e0d8","resolution":{"observed_at":"2026-08-10T23:19:02.099108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.773710Z","title":"Leveraging unlabeled data to predict out-of-distribution performance,","venue":null,"work_id":"68a6a046-e4d4-46c4-854f-9c1f4a74a5fe","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.102861Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:cd231099861510739cc9c618062c4e9bf0b8eb687591d3a5b66ca63976109691","observation_id":"a1291799-f858-46f5-b114-950b4b26af82","resolution":{"observed_at":"2026-08-10T23:19:02.776644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.765825Z","title":"Are labels always necessary for classifier accuracy evaluation?","venue":null,"work_id":"bcb5e95d-8ac2-4f29-840d-174fe6e47bf0","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.106942Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:f01efcb0991d9360200092036ad76e28003c440d0b76d444bbefaa486b8e6314","observation_id":"a13c2413-be53-44db-b299-acae43f47066","resolution":{"observed_at":"2026-08-10T23:19:02.769117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.756629Z","title":"Predicting out-of- distribution error with the projection norm,","venue":null,"work_id":"29f9845c-32d7-4ee6-be04-f3d73a959a16","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.109667Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:09139dcddec4aa875d6e29631523676af9f13caa29e74cea89304533a4d4f600","observation_id":"327ab1b6-d597-49f8-b18e-7b59a2ddeee1","resolution":{"observed_at":"2026-08-10T23:19:02.760868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.748837Z","title":"Data determines distributional robustness in contrastive language image pre-training (clip),","venue":null,"work_id":"54d937a8-bcba-4da6-8ed4-ec513a427da5","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.112361Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:fb7e92ecbebf6179e20c0958f3c72e2598b84b4108476d5b26ce309ccaae760b","observation_id":"c3384c91-811e-458a-8cee-ce8ae80128a6","resolution":{"observed_at":"2026-08-10T23:19:02.752385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.741642Z","title":"Does clip’s generalization performance mainly stem from high train- test similarity?","venue":null,"work_id":"0fe65da8-3f87-4dca-b420-020c70fd87f8","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.115218Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b2ad4a23d4c6241b1ecc36e41970093ca7f720555c91bfb8a1f81acf7b384d78","observation_id":"18584f6a-cff5-4044-b263-60498db4077c","resolution":{"observed_at":"2026-08-10T23:19:02.744442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01874","last_updated":"2024-03-04T09:30:35Z","snapshot_observed_at":"2026-08-21T18:24:56.462494Z","submitted_at":"2024-03-04T09:30:35Z","title":"A Survey on Evaluation of Out-of-Distribution Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01874","snapshot_observed_at":"2026-08-10T23:19:02.117741Z","title":"A survey on evaluation of out-of-distribution generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.117741Z"},"links":{"cited_paper":"/paper/2403.01874","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:d03c01db0c73d2b299810a8281ed1f39202e7dd2620216a695efd8f23f3dab8e","observation_id":"3bde1082-2188-4a4f-a509-69890d4088ec","resolution":{"observed_at":"2026-08-10T23:19:02.117741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15231","last_updated":"2024-02-23T09:47:27Z","snapshot_observed_at":"2026-08-21T14:12:58.601904Z","submitted_at":"2024-02-23T09:47:27Z","title":"Which Model to Transfer? A Survey on Transferability Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15231","snapshot_observed_at":"2026-08-10T23:19:02.120616Z","title":"Which model to transfer? a survey on transferability estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.120616Z"},"links":{"cited_paper":"/paper/2402.15231","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:dc2c4c2f9a3237c5b88fb91ed4074b0e69660d0079813f9f301842be697284d3","observation_id":"23247191-a828-4b72-9d61-913dc3761483","resolution":{"observed_at":"2026-08-10T23:19:02.120616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.732882Z","title":"Rankme: Assessing the downstream performance of pretrained self-supervised representations by their rank,","venue":null,"work_id":"41309b85-fdf1-4f95-b14d-e7568184032e","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.123697Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:7b8d4148f2f189df71bbf316ab2ed2a6e6bb1bc347b221b0af16b8b9c252a9fc","observation_id":"67e21d47-42b9-47c7-841a-68ede3983428","resolution":{"observed_at":"2026-08-10T23:19:02.736740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.725000Z","title":"Identifying useful learnwares for heterogeneous label spaces,","venue":null,"work_id":"3bd00dbb-b375-4076-aec7-c6aa535dfe28","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.126635Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:cc147988ca9109daa90812e93d06cfa8bbf2b0698a85d39ffc6cdc739598b46f","observation_id":"1a5b9b43-afd2-4f53-83e0-2523ef975313","resolution":{"observed_at":"2026-08-10T23:19:02.727669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.717446Z","title":"Etran: Energy-based transferability estimation,","venue":null,"work_id":"b7a04c80-2a00-4f19-beeb-1ecfc5509953","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.129072Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:704633f3a43ff65582a305b67e301cdc85affba14fbb868de0aa5559be66d2f1","observation_id":"bac8c173-40be-4e03-930c-158b51cd1e34","resolution":{"observed_at":"2026-08-10T23:19:02.720403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.710983Z","title":"Predicting out-of-distribution error with confidence optimal transport,","venue":null,"work_id":"2ad39ca6-ab41-440b-b958-20e39c6f67a1","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.132874Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:bffa1626323d1dde6c0522f59f9539dccd60e414770a1c041957acdcccf6202f","observation_id":"27d233fe-7d78-4b5d-a545-499a6c8ed392","resolution":{"observed_at":"2026-08-10T23:19:02.713537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.704078Z","title":"Data analysis and regression. a second course in statistics,","venue":null,"work_id":"000267f6-398b-4e79-b79a-27eb4fa9512d","year":1977},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.136115Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:126badc564e851e24a87526c9b18c4a7c093cba9e797ba888aa236b2009d9422","observation_id":"e3096a9c-fbdd-48cf-9bb4-7fa431d6cd33","resolution":{"observed_at":"2026-08-10T23:19:02.706480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.696154Z","title":"Tune it the right way: Unsupervised validation of domain adaptation via soft neighborhood density,","venue":null,"work_id":"e1faf778-ac1a-403e-95ff-088898184ca0","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.138546Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:9e7e3c5f71aa61751070b32bea0457344273ae5dd0dd1235c30d03dc5f5d30f8","observation_id":"07e1f4b7-5bf3-4985-9975-d8648163fea9","resolution":{"observed_at":"2026-08-10T23:19:02.699122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.686073Z","title":"Covariate shift adap- tation by importance weighted cross validation","venue":null,"work_id":"b63852a5-cdd6-4f36-b48b-5a058fe850ad","year":2007},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.142516Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:0572eccf3ce0fb28713dd70f590379c64d3498abf25eae26fbb243d50bd436fc","observation_id":"50eff583-92e6-4574-bb0a-40ebbff8ca86","resolution":{"observed_at":"2026-08-10T23:19:02.689740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.676986Z","title":"Towards accurate model selection in deep unsupervised domain adaptation,","venue":null,"work_id":"f170e7e1-dc81-4de1-9f7f-b7fd415e9a30","year":2019},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.146091Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:a5d400d5ea7d2e6509e381d534d7f42a129f7b86e929e78740ea598ba290eee8","observation_id":"591eb3d8-46f2-42c8-9f10-df2da74637e7","resolution":{"observed_at":"2026-08-10T23:19:02.680320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.669041Z","title":"Stochastic gradient methods for dis- tributionally robust optimization with f-divergences,","venue":null,"work_id":"2f030ced-be9c-4b42-ad31-b1a7dd794d61","year":2016},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.148593Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:27be5bc12e6eb4e3c5407220fba1596e4062151e6dc6ee715bea997b168264bc","observation_id":"7b35aab9-69dc-4412-a0f5-3156d5e7e5c2","resolution":{"observed_at":"2026-08-10T23:19:02.672181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02893","last_updated":"2020-03-27T19:07:58Z","snapshot_observed_at":"2026-08-16T03:32:37.688772Z","submitted_at":"2019-07-05T15:26:26Z","title":"Invariant Risk Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.02893","snapshot_observed_at":"2026-08-10T23:19:02.151663Z","title":"Invariant risk minimization,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.151663Z"},"links":{"cited_paper":"/paper/1907.02893","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:1ce7eee097ac92a2b315c9e52e94e441333e4b3c5907ee7334fef4a55c16e61e","observation_id":"add8cb75-5990-468f-ae31-0288f3206bb9","resolution":{"observed_at":"2026-08-10T23:19:02.151663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.660913Z","title":"Stable learning via sample reweighting,","venue":null,"work_id":"11c56542-d3ce-4721-8219-a19207230297","year":2020},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.155701Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:52359bee7c5463db5d95b6d6d3bef806433b78548e779f15f4472ba669b79d20","observation_id":"4c547453-dc72-408a-92b8-62b718f6e057","resolution":{"observed_at":"2026-08-10T23:19:02.664007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.652544Z","title":"A baseline for detecting misclassified and out-of-distribution examples in neural networks,","venue":null,"work_id":"8b2c4444-0232-43df-84f1-c8fccb3202fb","year":2017},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.159008Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:d872d06357ae8410b1fb8e912906bd8aab4e648898d96fdc04245e8d40e8a4ce","observation_id":"a61de187-c254-4af9-8795-bcda9ebcb386","resolution":{"observed_at":"2026-08-10T23:19:02.655597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.644680Z","title":"What does rotation prediction tell us about classifier accuracy under varying testing environments?","venue":null,"work_id":"1dace6be-52b3-4be5-907f-7a40751a5d6e","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.161587Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:112378bda98721e4e951db75e29c91eb79760a88d28992e52ad175e7e54cc366","observation_id":"b578e508-0b05-421a-8fdb-39e58819caf8","resolution":{"observed_at":"2026-08-10T23:19:02.647830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.634880Z","title":"Agreement-on-the- line: Predicting the performance of neural networks under distribution shift,","venue":null,"work_id":"a4320117-9bfc-4d70-8ddd-3af8b730c8aa","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.164953Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:d31c234b256c4ad861b39602f30ed13263a3a5fa0bd17f8c00ad141586ed2cd6","observation_id":"42141123-3547-4e66-940d-9e732916013f","resolution":{"observed_at":"2026-08-10T23:19:02.637822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.626670Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"ce1d1622-8a63-4cf2-ac97-93b29f01fabc","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.168153Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:530bc8178f1c39c9d4420f71e68c1458e8fcfab0fd9b90d430c480e914972345","observation_id":"69d6d889-6245-47ff-84ed-d09684bf3972","resolution":{"observed_at":"2026-08-10T23:19:02.630112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.617941Z","title":"I. mathematical contributions to the theory of evolu- tion.—vii. on the correlation of characters not quantitatively measur- able,","venue":null,"work_id":"1858c40b-2464-47b9-bed4-bae7160a893d","year":1900},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.171155Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:949b8bc031d060e55ff4828ae9c6829324535c39d53f53ce9fb90ff552d8380a","observation_id":"d0258e10-b13b-47bd-aa46-36d5a80fa574","resolution":{"observed_at":"2026-08-10T23:19:02.621254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.173527Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.173527Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:f7782ab5d1575426b2b77f080365150e6c527cc10707cb16dc97512b4819e6e5","observation_id":"3a956975-6cb9-4cde-a6d6-06c8787a739b","resolution":{"observed_at":"2026-08-10T23:19:02.173527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.607852Z","title":"Cats and dogs,","venue":null,"work_id":"882dd088-6c6a-4259-84c4-b6ca32ccf04d","year":2012},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.176231Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e02e74c866b717f9ab70029991924ffe95455c6e3ec20b463c38548faf69b77e","observation_id":"7101e1b9-9972-4dd6-9fd8-8c9d9db1b391","resolution":{"observed_at":"2026-08-10T23:19:02.610138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.600733Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":"2ecef7c0-5ca1-4504-81a0-b4fb8cdf27d5","year":2008},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.178912Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:21c0cbb3d6aff3a10065d518d5d81b44d7982acd5cea0f4568ebef28a0b2196b","observation_id":"2c700529-10b4-4c1e-8269-d91c1adf3467","resolution":{"observed_at":"2026-08-10T23:19:02.603200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.591175Z","title":"Reading digits in natural images with unsupervised feature learning,","venue":null,"work_id":"bec7c4b5-0f5f-48b0-9e2a-67a20e8dbe9c","year":2011},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.181346Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4916936ece0019ef637c27e3a8e3156f0430cbe32d0da6edfc392d466d1d9f79","observation_id":"ba33f10b-0d1f-43da-aa42-52ceab64c3e8","resolution":{"observed_at":"2026-08-10T23:19:02.595212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.581957Z","title":"Detection of traffic signs in real-world images: The german traffic sign detection benchmark,","venue":null,"work_id":"23f06d70-0c27-4134-9e47-2e446228aa1e","year":2013},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.185130Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b5d61c09324f8ef5a5e29de4a4ff790dbfb12e642b3a2d503b1dd52286ba27a2","observation_id":"fc7e523e-c7f9-45ea-ac45-d9a27606758f","resolution":{"observed_at":"2026-08-10T23:19:02.585413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.572919Z","title":"Describing textures in the wild,","venue":null,"work_id":"aef616e6-9c11-4054-98f3-d3e254241efa","year":2014},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.189062Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:88d23256a16f383004105ef01c438e0581b31ebd18b0365c1b26528ca0689a39","observation_id":"7ca0654a-f47a-4828-81f5-6b5bfc88c71a","resolution":{"observed_at":"2026-08-10T23:19:02.576201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.563008Z","title":"Yfcc100m: The new data in multimedia research,","venue":null,"work_id":"5e66926a-33bb-4ac1-b04a-35c1c3ab2f2e","year":2016},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.192584Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e022f2628454cbfed87a107e53164b1681a519f7361c4fdd1a19f8c1c70235b1","observation_id":"e08b47f2-ef10-484a-b07f-6fc1400b7c45","resolution":{"observed_at":"2026-08-10T23:19:02.566206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.550267Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":"c46b9754-31b6-47fb-8115-eb448c7e0655","year":2010},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.198741Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:c273bdc997be2471719d1a0f17d8f4a3235098ce333da875de29127e56568e68","observation_id":"0c4880aa-d471-4885-a240-66142a8a7251","resolution":{"observed_at":"2026-08-10T23:19:02.554864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.540618Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":"df127f1e-4ed6-4a7f-b5f8-03a048636091","year":1998},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.201847Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:a78484db8f8cf6794f1cec0d6c4b15ef14aefa0fb8a42746e822c38f5abba886","observation_id":"2ad95db0-05d0-42b8-b66c-0ea03d373dca","resolution":{"observed_at":"2026-08-10T23:19:02.544234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.532013Z","title":"Challenges in representation learning: Facial expression recognition challenge,","venue":null,"work_id":"60e87541-4a1a-4194-8dca-dcc3a05a87c1","year":2013},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.205503Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b2d11a6bfa224812113429a7c764785b60ae101e2943d5f9206baf88213f8be1","observation_id":"a387ba64-2dae-4eb9-a1ef-9d21e78f5e04","resolution":{"observed_at":"2026-08-10T23:19:02.535101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.523849Z","title":"On the importance of feature separability in predicting out-of-distribution error,","venue":null,"work_id":"ba98c4e2-bb52-4f79-9a3b-7cd1bc0dd446","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.209061Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:69cdf68dad476b46f667f15967e1ccc91b82f5a818f1145106836a87f1e6e06d","observation_id":"45258e42-4956-4e3a-aa1a-87627e74055d","resolution":{"observed_at":"2026-08-10T23:19:02.527167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.513833Z","title":"Unsupervised representation learning by predicting image rotations,","venue":null,"work_id":"a2272396-500f-45a0-9ead-8b8814548429","year":2018},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.212042Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e3722b9d45d315f48e891095bac271cc7fa54ed68d88787a93d31e5caa639264","observation_id":"315a85bc-873d-463f-97c0-b37bf5325664","resolution":{"observed_at":"2026-08-10T23:19:02.517108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.467260Z","title":"The use of multiple measurements in taxonomic prob- lems,","venue":null,"work_id":"0369e585-7f21-469b-931c-a5dd89d759be","year":1936},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.214634Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e842a47e506adb3ed68d68f7e05ddd6edff1d61c63e3f59974b2e646769bb135","observation_id":"a88f3d46-786e-4e23-acdb-27219d5b6f06","resolution":{"observed_at":"2026-08-10T23:19:02.508560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.217025Z","title":"Silhouettes: a graphical aid to the interpretation and validation of cluster analysis,","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.217025Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:3ea670d2840debdc249019482286af305e07236d58d711fbc329ed194c008ff9","observation_id":"218e96b0-d58b-4d22-9b7a-d5f41067cfa0","resolution":{"observed_at":"2026-08-10T23:19:02.217025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.219537Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.219537Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:4bd20930178de1f0e3e1ced8a14af3da7ba7a9c7b7942035ad55723424b08298","observation_id":"c39edd1e-2beb-494c-b54b-d9f797f5ae56","resolution":{"observed_at":"2026-08-10T23:19:02.219537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.386859Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"c05e34dc-cbb8-487a-ab72-454af6c4acb9","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.222327Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:ea3f9959f10336de33c836cac9422214845195c7316b8e82f5fb57426e22144b","observation_id":"7995dc37-9bf7-441f-b9fc-c302ac82e98e","resolution":{"observed_at":"2026-08-10T23:19:02.422639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.378598Z","title":"A convnet for the 2020s,","venue":null,"work_id":"85f8e36d-924f-40a3-b9c9-3692fee603d6","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.225312Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:e6f85fb220c0706f061b2d4ebee770ae9329db642524b94b2ab4d740bf9c3b2e","observation_id":"119a2684-2c0c-439d-9f05-922bad6cc5cc","resolution":{"observed_at":"2026-08-10T23:19:02.382172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.368939Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs,","venue":null,"work_id":"c6f8a196-ea6a-43a6-943d-a776ae878a35","year":2021},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.227883Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:a370091536c3ef1a4d7b657638b3a7c22e38e22bfa43e65776dd9540a33be2fe","observation_id":"675996f6-57fd-4a99-ae23-b26f0b48b90a","resolution":{"observed_at":"2026-08-10T23:19:02.372675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.357318Z","title":"AltCLIP: Altering the language encoder in CLIP for extended language capabilities,","venue":null,"work_id":"bf6c1f39-38a6-4537-a59b-f9501a7346c9","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.230309Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:2a73fc01c1685399c9181ab74644818186447409997a8e37956b4f57f3d2dfaa","observation_id":"82cc4b91-9e7e-4ad3-8f3c-c26e6c5d8102","resolution":{"observed_at":"2026-08-10T23:19:02.362356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.347505Z","title":"Groupvit: Semantic segmentation emerges from text supervision,","venue":null,"work_id":"ed5b7321-4e99-4fab-a223-339417450bbe","year":2022},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.232910Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:7434ecb755c1317ef0c5e43d91bcf7dd0b19920232057ae02b705e8005ce984b","observation_id":"d7237b80-b802-4761-859c-448fcacc02af","resolution":{"observed_at":"2026-08-10T23:19:02.350740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00275","last_updated":"2023-02-01T06:44:07Z","snapshot_observed_at":"2026-08-16T15:58:36.220567Z","submitted_at":"2023-02-01T06:44:07Z","title":"Learning Generalized Zero-Shot Learners for Open-Domain Image Geolocalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00275","snapshot_observed_at":"2026-08-10T23:19:02.235754Z","title":"Learning generalized zero-shot learners for open-domain image geolocalization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.235754Z"},"links":{"cited_paper":"/paper/2302.00275","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b85a4515bbb0e3459895352d8d1cc135008ad804dfcf695e51742359520ade94","observation_id":"a3b48329-45f1-4ab2-856a-bec9f04e4f0e","resolution":{"observed_at":"2026-08-10T23:19:02.235754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-17T12:17:37.741844Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-10T23:19:02.239160Z","title":"Demystifying clip data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.239160Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:8be417d7b50b4d9d1f370e34d8b10d489659ed8e304d3dc3ab00b5e17720ed25","observation_id":"b63e8fcc-ea48-4330-8d0f-23b2ae3a5fef","resolution":{"observed_at":"2026-08-10T23:19:02.239160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-08-18T14:56:57.492279Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-10T23:19:02.242350Z","title":"Large-scale domain-specific pretraining for biomedical vision-language processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.242350Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:b9e96390dce32ba2b399708e7f7afa61ed967bb76ec6c8c674681c85215920cf","observation_id":"8829e10d-c0a3-4c87-a026-2ede33fedede","resolution":{"observed_at":"2026-08-10T23:19:02.242350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11207","last_updated":"2025-01-13T18:16:34Z","snapshot_observed_at":"2026-08-16T15:22:43.334519Z","submitted_at":"2023-06-20T00:14:47Z","title":"Quilt-1M: One Million Image-Text Pairs for Histopathology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11207","snapshot_observed_at":"2026-08-10T23:19:02.245892Z","title":"Quilt-1m: One million image-text pairs for histopathology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.245892Z"},"links":{"cited_paper":"/paper/2306.11207","citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:a309434b0eeaeab319df02b03a195cf005b5c866c7b87c4fb2ddbd5b90468a5f","observation_id":"60cb4d52-1c1d-4b93-8581-ff0c846425f1","resolution":{"observed_at":"2026-08-10T23:19:02.245892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.338007Z","title":"BioCLIP: A vision foundation model for the tree of life,","venue":null,"work_id":"70d2d8d5-c297-4908-81fc-e8939709f549","year":2024},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.248744Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:8a6968cf6f8e4842c67cc000ab57f351b62c8d8316167cb37774b876f819df0d","observation_id":"8e2650a0-8233-468f-8cc3-09fc29526389","resolution":{"observed_at":"2026-08-10T23:19:02.341422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:02.327499Z","title":"Gpt-4: Generative pre-trained transformer,","venue":null,"work_id":"b9e7ef62-b03b-4613-8d9d-27f484f83bdd","year":2023},"citing_paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:02.251395Z"},"links":{"citing_paper":"/paper/2412.20682"},"observation_digest":"sha256:ca5f8e76826b602c317817d19c344cf58066a5600a2e702925bab7ef215feb2e","observation_id":"cb36a3e1-a99f-4dcc-8527-2511724e5102","resolution":{"observed_at":"2026-08-10T23:19:02.331857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20682","last_updated":"2024-12-30T03:26:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T03:38:18.967448Z","submitted_at":"2024-12-30T03:26:53Z","title":"Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2412.20682."}