{"as_of":"2026-08-13T12:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08a1fe0ffd2629bd57683cd7c809a86f6aefa103df19297ba3646144f9134f40","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:13:44.193550Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:17:07.129873Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T23:17:14.107540Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.04925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04925","snapshot_observed_at":"2026-08-05T23:17:14.107540Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","venue":"cs.CV","work_id":"da99e0c8-c0fa-48ca-ac7e-9b6955e7bd85","year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-13T01:29:52.382726Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:07.129873Z"},"links":{"cited_paper":"/paper/2412.04925","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:7b66f27c7b2bc84c24b44f33a012ee4de6d5fcf8c01423eddf16bfd2af16c980","observation_id":"f57f3c35-c529-4f4c-a1ad-ecf8c384a91e","resolution":{"observed_at":"2026-08-05T23:17:14.113141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04925/citation-record","integrity":"/paper/2412.04925/integrity","json":"/paper/2412.04925/citation-record.json","paper":"/paper/2412.04925"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.789264Z","title":"Align your prompts: Test-time prompting with distribution align- ment for zero-shot generalization","venue":null,"work_id":"4dcb7564-20ed-453b-8c03-573f63a72c54","year":2024},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.013533Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:de2519546a635b12a38cb02c845568f7126cd1c29025931f7563b73e0b267b50","observation_id":"4c5b4d78-05bb-4f8d-8e85-d7712913ad91","resolution":{"observed_at":"2026-08-11T21:13:44.793070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T21:13:44.017783Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.017783Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:a10b47cc97359d533e2ade3d20a89ef7556b55131494eaa965cbb6d9db4753f6","observation_id":"b2902c41-149b-49dd-98f0-bd1bbefbfa9e","resolution":{"observed_at":"2026-08-11T21:13:44.017783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02818","last_updated":"2021-08-05T19:05:57Z","snapshot_observed_at":"2026-08-09T20:10:30.354625Z","submitted_at":"2021-08-05T19:05:57Z","title":"Evaluating CLIP: Towards Characterization of Broader Capabilities and Downstream Implications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.02818","snapshot_observed_at":"2026-08-11T21:13:44.021592Z","title":"Evaluating clip: towards characterization of broader capabilities and downstream implications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.021592Z"},"links":{"cited_paper":"/paper/2108.02818","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:a821b5942ddc979f28790aeafe0109174de0d1bf2c68a1d3941a0301f0e78c51","observation_id":"80eeed1b-cf06-4f42-b6ea-ae009043a8e2","resolution":{"observed_at":"2026-08-11T21:13:44.021592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.777280Z","title":"A simple zero-shot prompt weight- ing technique to improve prompt ensembling in text-image models","venue":null,"work_id":"92db1705-af82-401a-801a-000097179757","year":2023},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.025421Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:5acc5403470f3e863705197233ab6f80386c6db49681b4651eaf170735e2c1d8","observation_id":"ca24263d-8675-43ff-82de-a98b1c9b3f3a","resolution":{"observed_at":"2026-08-11T21:13:44.782087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.029201Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.029201Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:05fc89d3148c2ec6ea99c4008acdcdb05be36d9f0ea988d45e8fa5a681036b2d","observation_id":"da327fa6-341a-4f96-9a91-8ee4acdb729c","resolution":{"observed_at":"2026-08-11T21:13:44.029201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.760642Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":"d0171d25-7555-444d-b45c-0126056ae1bd","year":2014},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.032641Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:5f05e9784389152ca752acc1e14ddcddfd26d2f2ec9f2963d37c3b66fdd2b35e","observation_id":"1a2a3f33-eca4-4358-bf0e-5ba964716db2","resolution":{"observed_at":"2026-08-11T21:13:44.764376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.747136Z","title":"Describing textures in the wild","venue":null,"work_id":"34576fb5-2d1d-495b-bd00-234a571aa828","year":2014},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.035577Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:1b79076cd7fa809568e941d6b5d3abbc88f16b51d4db45f7240e14151e6b7188","observation_id":"e9fe905d-878b-4379-9e73-7fbd6f20a818","resolution":{"observed_at":"2026-08-11T21:13:44.752129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.734609Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"eba8457e-3ec8-4901-bd05-9e66f9347e51","year":2009},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.038760Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:046bc436603a631465d387f57e7024c61e90a5845681e4543df9759fe871d35c","observation_id":"1e8b5e83-95f6-403e-ada3-d857740eaf90","resolution":{"observed_at":"2026-08-11T21:13:44.738371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.721184Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"36a8075e-621f-4a95-b629-abbd16dd9361","year":2010},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.041591Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:025b3b2ae2a75d8804f0819261ffbc31f19c36af9ff275b64def956c24e1abbc","observation_id":"5a4bb9ad-65fb-4ca6-8656-9476b39037a1","resolution":{"observed_at":"2026-08-11T21:13:44.725945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.706656Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":"b3be362b-1684-4293-9ded-bf4a22407a71","year":2004},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.044699Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:3cbdc5b2bb224cabb3a1304d8a9b7bfb763fdf3db6dcb0d1a85b06dd2b8512c3","observation_id":"a53f1f22-d858-43fa-904d-7ca2e97a269e","resolution":{"observed_at":"2026-08-11T21:13:44.711587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.686374Z","title":"Diverse data augmentation with diffusions for effective test-time prompt tuning","venue":null,"work_id":"22c00dae-0ce8-433a-98f2-86a4e607a3e4","year":2023},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.047526Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:bfe2eed038eac4c529d0928658d59ff0f22effa7fb1cb10bccfb067ae37126d9","observation_id":"c26a6f22-698e-4ed1-bb14-ac4c2237c743","resolution":{"observed_at":"2026-08-11T21:13:44.691084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09592","last_updated":"2022-12-22T00:55:29Z","snapshot_observed_at":"2026-08-10T17:31:30.589954Z","submitted_at":"2022-06-20T06:43:17Z","title":"DALL-E for Detection: Language-driven Compositional Image Synthesis for Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09592","snapshot_observed_at":"2026-08-11T21:13:44.050326Z","title":"Dall-e for detection: Language- driven compositional image synthesis for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.050326Z"},"links":{"cited_paper":"/paper/2206.09592","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:e842c2bf880fc41956361d4fa1ef305580da813ffe4097ca8f5baae79581ca3a","observation_id":"fff3beca-f4e4-4365-9308-895dff970a34","resolution":{"observed_at":"2026-08-11T21:13:44.050326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.673125Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"c6a3bd22-d536-4b54-a45c-aac3750b9cc1","year":2019},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.053595Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:0c9a817c553073f04601d134d084de829070237b4530bbdb3962f482aacf58cc","observation_id":"1eee6238-ad66-4cf8-b4b0-be9d8ba1aa14","resolution":{"observed_at":"2026-08-11T21:13:44.677923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.660065Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"b04a24ae-46b3-45ad-a8aa-24ba647185ee","year":2021},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.056982Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:e98106fb9f11791f9f6f3666c1ba6b1b4759bf882bf724d06f46a248755bb718","observation_id":"1527240c-bd24-48e6-b9ad-ebf0fd7f3a00","resolution":{"observed_at":"2026-08-11T21:13:44.664798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.647628Z","title":"Natural adversarial examples","venue":null,"work_id":"3e03d55d-4db5-4e66-a0fe-e7d4a29cbcdf","year":2021},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.060288Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:a906cb90c08bfbf24a3c58bf33b882fafa17e0cc0bc85bd93442aa1876a13408","observation_id":"69fc188b-2479-4894-8279-7369303355be","resolution":{"observed_at":"2026-08-11T21:13:44.651885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-11T21:13:44.064083Z","title":"A survey on hallucination in large language models: Principles, tax- onomy, challenges, and open questions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.064083Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:460861896f9e5c259fccb4393149c54c4587a8ecdd8665a077f461f20a07c6dc","observation_id":"bf38910c-e154-4ac9-856a-4783f4587cc1","resolution":{"observed_at":"2026-08-11T21:13:44.064083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.068604Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.068604Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:fd003893e5db7bc14874afea97b5fe70e01362a6fb030926969f7a36d19e948f","observation_id":"b438fe9b-4536-4a48-bac2-0e0a8b23ec8b","resolution":{"observed_at":"2026-08-11T21:13:44.068604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.627160Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"6703f395-8069-497f-91d5-09f8173acba9","year":2013},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.072115Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:5b22c4917eecee00b4cca511cb60a3475d1bf691e1c985599a37126776a29a2f","observation_id":"3e76db35-affb-4a9b-a92f-b30300acb448","resolution":{"observed_at":"2026-08-11T21:13:44.631486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-11T21:13:44.076053Z","title":"Language-driven semantic seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.076053Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:c5afc0a876d28e153c93831b0f2002ebbbf5eb3b5ad92dd1d34d95d33ac82074","observation_id":"e9adbf54-455a-49da-b1af-a28ab3479a6a","resolution":{"observed_at":"2026-08-11T21:13:44.076053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.614916Z","title":"Swapprompt: Test-time prompt adaptation for vision- language models","venue":null,"work_id":"09dfa1e8-ca59-4b78-8cb4-ddd6db55b91b","year":2024},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.080250Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:961670382d5d3926849cf4bf13ef2ad2b7739e02d55f934fdb4cb1b66fe0d902","observation_id":"bb0cc363-aafb-48cb-aea9-e032e54de51e","resolution":{"observed_at":"2026-08-11T21:13:44.619480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-11T21:13:44.084615Z","title":"Fine-grained visual classi- fication of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.084615Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:4cae7d318506942475dd7732da18a187b29ee87c5e8e6d3e5705f9ee73378b57","observation_id":"71129108-89ea-4964-88a8-6285381b467b","resolution":{"observed_at":"2026-08-11T21:13:44.084615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.601100Z","title":"A survey on bias and fairness in machine learning","venue":null,"work_id":"7ec8dce4-efec-4fdb-ba0b-d8aa8b60c6eb","year":2021},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.088487Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:740e064d8d2e351a5c7a0dabea9b7041161fade178377b34146e020af740d5d0","observation_id":"dc53f7a7-2c47-44e0-b5bc-46453d619119","resolution":{"observed_at":"2026-08-11T21:13:44.605691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.588175Z","title":"Visual classification via description from large language models","venue":null,"work_id":"68eb1c22-b7c5-4585-92db-7a21be77789d","year":2022},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.091737Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:b46ce595c05d194e20b59e4e28aa00e59d726cf1983bdc16dc2593ec9f9337e7","observation_id":"4a599989-82e6-4182-a809-94f2210ef13c","resolution":{"observed_at":"2026-08-11T21:13:44.592653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04412","last_updated":"2022-12-08T17:10:31Z","snapshot_observed_at":"2026-07-06T14:28:25.630901Z","submitted_at":"2022-12-08T17:10:31Z","title":"Task Bias in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04412","snapshot_observed_at":"2026-08-11T21:13:44.095014Z","title":"Task bias in vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.095014Z"},"links":{"cited_paper":"/paper/2212.04412","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:965c7691f29f507f361b3da8c688a4518e5aeb471ff15828fe76672376891a1b","observation_id":"b4c50720-05cb-4b0c-a58d-0618a84e0baf","resolution":{"observed_at":"2026-08-11T21:13:44.095014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.575184Z","title":"Meta-prompting for automating zero-shot visual recognition with llms","venue":null,"work_id":"adda3fa9-95bb-4dad-9aae-903ecc05f6d2","year":2024},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.098762Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:00594ead4d69c9a6eaaaeb6ee48c47e47158f49df26a7a8177c5f52570cf254b","observation_id":"e466e209-dfec-48c3-bfd9-d5e394de5e4f","resolution":{"observed_at":"2026-08-11T21:13:44.579942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.561536Z","title":"Computational homology","venue":null,"work_id":"5acc08d5-e1ce-4c69-96de-280e4cc62935","year":2004},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.102265Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:990b885bccfbd041d95058b2426a836dda6b67d85a5808f15562a00cbe60e113","observation_id":"0a23bcdb-4704-4277-92b7-a4aeb0a6df7c","resolution":{"observed_at":"2026-08-11T21:13:44.566131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.549104Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"8a0d4381-3989-495e-a1e0-5366cbe78a13","year":2008},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.105482Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:5b43d81e6b0bfd483288097c4ed3f1b7d0d2082510ba9c863d5862d7470c4174","observation_id":"7ebca435-d271-4ed5-9db9-85961dc18701","resolution":{"observed_at":"2026-08-11T21:13:44.553141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.528253Z","title":"The neglected tails in vision-language models","venue":null,"work_id":"6796f56a-0f65-45df-8916-49799112ae66","year":2024},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.108770Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:b2b5279c799187c57ff3a16953df8d9bdc69942db625ea79be79e2cf700001fb","observation_id":"aabb3147-30d8-4eb9-b9b0-3145f9475fd0","resolution":{"observed_at":"2026-08-11T21:13:44.539489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.112345Z","title":"Cats and dogs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.112345Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:3a55439febf0d28752c9d47a98215870d2e158a45470ff1aaa3be1d9f48df94f","observation_id":"285fb35a-3718-457f-b33c-572f612335dc","resolution":{"observed_at":"2026-08-11T21:13:44.112345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.509671Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":"a3533df1-9496-47e3-beec-6929ab167e9e","year":2023},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.115818Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:879b8e8f3c2028eb4c8d27fef56d8cd99b4c68c17ff8ff9784e17e0838c49124","observation_id":"9173c4f0-f354-4c1a-a910-d2392fae8e88","resolution":{"observed_at":"2026-08-11T21:13:44.514483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.498682Z","title":"Online zero-shot classification with clip","venue":null,"work_id":"e3476d79-690f-4e1a-8090-61ab237450d1","year":2024},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.118950Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:08fc8ff25613a130df578bdb94755586acfb461f6ec68eb66a5db66374977e9e","observation_id":"c4371700-b222-4125-a618-71c72f783d00","resolution":{"observed_at":"2026-08-11T21:13:44.502453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.487509Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"f7913e53-64a7-4b2e-8b7a-063baa3c2e74","year":2021},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.121860Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:4fb41ef624888c87662451b035a1519ca1b2735d0e48dcc439a852fccfa20c1d","observation_id":"c82159ec-9bf6-46f0-93ba-5b415beda87a","resolution":{"observed_at":"2026-08-11T21:13:44.491390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.124465Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.124465Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:378656f36bc6231c017831e926e46585fab56d078de5e87c669f8cfa6d10d994","observation_id":"5754c06b-88ab-4360-8ba5-831f33b89612","resolution":{"observed_at":"2026-08-11T21:13:44.124465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.470471Z","title":"Do imagenet classifiers generalize to im- agenet? In International Conference on Machine Learning, pages 5389–5400","venue":null,"work_id":"1de6791f-a1c3-4d85-88a2-f217b90ed9e9","year":2019},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.127097Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:936d0738f436ada3a504a340f3f0105ee487977c05678f77350812f9ce3e16b1","observation_id":"34a1a27c-79c1-4fdc-8249-b6fed442f915","resolution":{"observed_at":"2026-08-11T21:13:44.474234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.460510Z","title":"Waffling around for performance: Visual classification with random words and broad concepts","venue":null,"work_id":"c094f3db-b8a2-4d99-b441-3c004e3e5005","year":2023},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.130623Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:390cae94509ce6c4302cc3f0957ee48a00c2b0847783ad9e4d14b777b7b0cf07","observation_id":"d9dddf58-a335-4d98-bdfa-1f926a050dfb","resolution":{"observed_at":"2026-08-11T21:13:44.463745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T21:13:44.133416Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.133416Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:bee7fa1181aab553cdacda7f6a76c49158f93a69956d1f7fea53fc636a45ddde","observation_id":"d8080680-1b7a-43d6-a15c-ab9d7f73b99c","resolution":{"observed_at":"2026-08-11T21:13:44.133416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.136422Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.136422Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:986376471c6d20e56d944235cd4cb941d6932c396fa8f5e42e9f12eb540b6841","observation_id":"db75dae4-cd3e-4633-b65a-f6a9350fb626","resolution":{"observed_at":"2026-08-11T21:13:44.136422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.444167Z","title":"Test- time prompt tuning for zero-shot generalization in vision- language models","venue":null,"work_id":"990d0b67-1ef5-4636-b170-96ea8b3581e4","year":2022},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.139591Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:8379755cc06ec4b2eb98a96080c9704ba7b4e14a10077c3266063894cb715804","observation_id":"e0595e01-9e95-4962-be3f-2ecd009555b3","resolution":{"observed_at":"2026-08-11T21:13:44.447585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-12T17:34:19.526460Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T21:13:44.142886Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.142886Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:136c09a167293876cb1bee421dfe0fccce65f861cbcc156f4c7aca49f14d97e7","observation_id":"58486a4f-d598-4cc8-a9d1-414c7ac6003a","resolution":{"observed_at":"2026-08-11T21:13:44.142886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12952","last_updated":"2024-12-10T22:53:16Z","snapshot_observed_at":"2026-08-13T00:50:06.939278Z","submitted_at":"2024-03-19T17:54:34Z","title":"Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12952","snapshot_observed_at":"2026-08-11T21:13:44.146822Z","title":"Just shift it: Test-time prototype shifting for zero-shot gen- eralization with vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.146822Z"},"links":{"cited_paper":"/paper/2403.12952","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:3a5c7a5b9517a4ebb5f3a570542b68e6949be1a580c57247b3b6ddb4758bc6d6","observation_id":"01ebb551-3845-4142-8a4d-10fe362baded","resolution":{"observed_at":"2026-08-11T21:13:44.146822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.432584Z","title":"Eigenfaces for recogni- tion","venue":null,"work_id":"44fedcde-04e1-462b-bd74-b46fc4467ff5","year":1991},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.150370Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:aebd0e86659deba47d7b2b9992b945f17ff866923b8b7f4afa32493757e91731","observation_id":"c5472012-72dc-41f3-a417-8654c5339dde","resolution":{"observed_at":"2026-08-11T21:13:44.436632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.419990Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"6faef260-8f5c-4336-9321-1613ece5ac5b","year":2019},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.154281Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:e11615a38fd672624366849be18daac2aafb9f2034b1f9d0f0fffe569c028110","observation_id":"79f2894e-028f-4fb6-b1eb-daa0d530e202","resolution":{"observed_at":"2026-08-11T21:13:44.424497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.409788Z","title":"Topological data analysis","venue":null,"work_id":"b1cd1a57-01ef-4bb1-aea4-fb0fa4f1a420","year":2018},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.157686Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:8290781536a8aaf9a5fbf7707eaca66e52856762ccc9a03a246e47271c95ea90","observation_id":"ab3d6521-ade8-416c-a13d-68bfe0f8bb8f","resolution":{"observed_at":"2026-08-11T21:13:44.413269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.399092Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"ba52b249-ebcd-44c5-85bc-59b68f72b79d","year":2010},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.161484Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:7ece7db2b74d6c706d9f4f0977c6899587605d38488f60dddcdc61be0ac699c6","observation_id":"172b872f-e402-4994-9f4d-d00344460942","resolution":{"observed_at":"2026-08-11T21:13:44.402843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.387942Z","title":"Alip: Adaptive language-image pre-training with synthetic cap- tion","venue":null,"work_id":"7abaee1e-530e-4671-b69a-6d40f4d6163e","year":2023},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.165566Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:81e844831ec1864450c8f48470c3c753ae057ca8377e51e8c88f1bebd840148d","observation_id":"0a67b953-4be4-4586-8ec3-2754336d7e1b","resolution":{"observed_at":"2026-08-11T21:13:44.391886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.377073Z","title":"On the test-time zero- shot generalization of vision-language models: Do we really need prompt learning? In CVPR, pages 23783–23793, 2024","venue":null,"work_id":"8b0d46d1-04a5-4d6d-9567-37e210a0baba","year":2024},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.168874Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:9c3b3d591af330720842e75fbee612b1728d5eae0e439fb20197d72097d09e84","observation_id":"6d771f7b-a3ed-4201-b26d-fb90cdbbcad4","resolution":{"observed_at":"2026-08-11T21:13:44.380846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.172126Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.172126Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:85207547ee4e807f02f763de382611a84f420d6e8ac4321f7ceef5eec7fe81ac","observation_id":"a6d647a7-b077-4206-8abd-263db31f8e2d","resolution":{"observed_at":"2026-08-11T21:13:44.172126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-11T21:13:44.175298Z","title":"Siren’s song in the ai ocean: a survey on hallucination in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.175298Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:028589e790f61041f0f4b316093d42ab27a5af5bae6f3d55469a056020045f36","observation_id":"895b82f3-2a3b-41c5-a627-ea281d9769c3","resolution":{"observed_at":"2026-08-11T21:13:44.175298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.358826Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"ba0b6455-fc2f-4da4-abb0-2dd93c862916","year":2019},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.179092Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:c3a5d89c8e0ae3c63b6e2b6de5507cfcaacbedce26c3409de453366459f6fc37","observation_id":"71924acc-8c1e-4eed-ae35-ae33c50ae850","resolution":{"observed_at":"2026-08-11T21:13:44.363296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.183294Z","title":"Extract free dense labels from clip","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.183294Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:4c2154cd8072133eaeef5ad060e99bc25b75dc9a7a36595643c155218a08eae4","observation_id":"296f95f7-5701-4a5f-bee5-2865cd8537b1","resolution":{"observed_at":"2026-08-11T21:13:44.183294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.342603Z","title":"Progressive point to set metric learning for semi-supervised few-shot classification","venue":null,"work_id":"619a6424-232e-41c1-81f8-86ec9cb4b8f1","year":2020},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.186548Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:9f9c5e4ccbbf5460106f4c594626630b0a32b26a18d0cec845a05f5cd3be9391","observation_id":"51eb5574-034f-4214-ad25-56cf2ad4c24f","resolution":{"observed_at":"2026-08-11T21:13:44.345730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.332203Z","title":"Persistent homology: An introduction and a new text representation for natural language processing","venue":null,"work_id":"be74c8e8-1a49-4cd3-ad74-3148f0cbcf91","year":1953},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.189821Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:b81d85d765a5a1536614afbc7b31497f54e1c33a81715e424aabe328f0be7dfb","observation_id":"e94b732b-ad87-46fc-8c0b-75ab9821089b","resolution":{"observed_at":"2026-08-11T21:13:44.335999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:13:44.322123Z","title":null,"venue":null,"work_id":"b50d11fd-a03d-4963-8cc8-556a510dc583","year":null},"citing_paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:13:44.193550Z"},"links":{"citing_paper":"/paper/2412.04925"},"observation_digest":"sha256:fac69a14a05f938854136d221d12551d324397762f142a3eda3cadf1ace4499a","observation_id":"a18c0b6b-75fc-4114-b700-d3886203c85a","resolution":{"observed_at":"2026-08-11T21:13:44.325828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04925","last_updated":"2024-12-06T10:26:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:13:59.943787Z","submitted_at":"2024-12-06T10:26:51Z","title":"$S^3$: Synonymous Semantic Space for Improving Zero-Shot Generalization of Vision-Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2412.04925."}