{"as_of":"2026-08-20T02:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3cfc9d4ae8b648991378e99a3437a0afa808846e5e23cbd08a1363601269fb8d","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:15:01.570253Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07077/citation-record","integrity":"/paper/2412.07077/integrity","json":"/paper/2412.07077/citation-record.json","paper":"/paper/2412.07077"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.946324Z","title":"A simple zero-shot prompt weight- ing technique to improve prompt ensembling in text-image models","venue":null,"work_id":"22833667-3d19-4f78-8e2f-0ba131e2829e","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.407168Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:c46e09848df60b9c46c037817344ac4d974ec41abceef50a47bd8aacf3f29c8d","observation_id":"863d29a8-d7a7-441d-bfaa-56058254d596","resolution":{"observed_at":"2026-08-11T19:15:01.949630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04906","last_updated":"2022-01-28T12:23:37Z","snapshot_observed_at":"2026-08-12T14:02:29.797842Z","submitted_at":"2021-05-11T09:53:21Z","title":"VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04906","snapshot_observed_at":"2026-08-11T19:15:01.411549Z","title":"Vi- creg: Variance-invariance-covariance regularization for self- supervised learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.411549Z"},"links":{"cited_paper":"/paper/2105.04906","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:42a3b71be4853b3781c7b531c30e3996931dcf22abf186734e2b33d25a6ad54d","observation_id":"2b089992-b5e5-44a0-b5d6-8f5113b72602","resolution":{"observed_at":"2026-08-11T19:15:01.411549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.416764Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.416764Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:268810b75fec12a016740156b13f08e2e25ece3d74284e8b74edceb19d560101","observation_id":"1cec72d7-c762-49c6-be45-0befd42e7a72","resolution":{"observed_at":"2026-08-11T19:15:01.416764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.420368Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.420368Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:fc22f74f533a3dc6d867db0b68e7fe6ed8d083b616dfc008e9efa1739f064d95","observation_id":"dc160ba5-23ad-4da6-a9cb-128aeaeb912f","resolution":{"observed_at":"2026-08-11T19:15:01.420368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.927113Z","title":"Apollo: Unified adapter and prompt learning for vision lan- guage models","venue":null,"work_id":"a4c1f2ef-1673-42eb-b287-ec665178fbbb","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.425144Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:efc3faff2c1590aca57beaf8a7690f50028ee81e8a9b2862151f2d4ab7cfbadd","observation_id":"9da2735c-f6f8-429e-849f-2e8a98ca542b","resolution":{"observed_at":"2026-08-11T19:15:01.930483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.429432Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.429432Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:d602161f753d68e7c89f156874c887d2a7451e720b6886b25dc12c7b0c588ef4","observation_id":"e761425b-e13a-4737-be5d-3224d063b9e4","resolution":{"observed_at":"2026-08-11T19:15:01.429432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.433992Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.433992Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:0572ae53683aee4bca3bacd10f98f94deba9a8d79ea943112a836a801fc3729f","observation_id":"ff319a7b-b599-4f03-95ce-c17e6a1e731a","resolution":{"observed_at":"2026-08-11T19:15:01.433992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T19:15:01.438060Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.438060Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:200ee96b6523bbad00a82ba7679318f6181effc67cee72b8785f39e847b5d7c2","observation_id":"d0512a12-4962-4a4a-bb69-e5688a1a4575","resolution":{"observed_at":"2026-08-11T19:15:01.438060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.907492Z","title":"Ensemble methods in machine learn- ing","venue":null,"work_id":"02c8e2d9-3e5f-4321-aeda-bde9e73ec259","year":2000},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.441673Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:b1318a5ea64d07d18df24412996dcceffd22cb8b0b9d4e8c0d99090ecd6103b9","observation_id":"c99f3193-3d9b-480a-af93-dee5cee0dbc4","resolution":{"observed_at":"2026-08-11T19:15:01.911369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.898462Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":"36c70532-a375-423d-9cbf-bf64d7864e4a","year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.447653Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:341a592f2bbf6a830878e9fbd8b349209399e8e6c6f9c4f9a1a39999ecf2aeaf","observation_id":"60f3cfde-f374-45b0-bedb-594b853c2b61","resolution":{"observed_at":"2026-08-11T19:15:01.901814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.890774Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":"95ebf8b0-ff48-4868-a78a-899a032716ba","year":2004},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.455231Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:2d913435b678375bf24de736d38f5e41c3ead7756ed96a3bec3c7e63905aa1c7","observation_id":"f020de12-0265-4aa2-a42a-1014b57615f2","resolution":{"observed_at":"2026-08-11T19:15:01.893447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02757","last_updated":"2020-06-25T03:57:04Z","snapshot_observed_at":"2026-08-19T03:38:32.285921Z","submitted_at":"2019-12-05T17:48:18Z","title":"Deep Ensembles: A Loss Landscape Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02757","snapshot_observed_at":"2026-08-11T19:15:01.465113Z","title":"Deep ensembles: A loss landscape perspective","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.465113Z"},"links":{"cited_paper":"/paper/1912.02757","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:96e76ec63724fc2643d7fa957ebe4107f8ab4296c893c66d6deea25a33de428c","observation_id":"8217c723-6701-4d76-984a-28957de6a37e","resolution":{"observed_at":"2026-08-11T19:15:01.465113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.480989Z","title":"The vendi score: A diversity evaluation metric for machine learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.480989Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:0012fc12f1194ebd5bb9ad0e8b50cca1d61edfda661b152404c24a973fa8dbe1","observation_id":"95225b2a-49f1-4517-a5fd-d7f7fac22ff4","resolution":{"observed_at":"2026-08-11T19:15:01.480989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.483874Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.483874Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:9de40f4aaedbccdb87d6868809d9fbfabe9771505c7a4c9b9995e3ffae6a0acc","observation_id":"2a055654-dd19-4e67-b5c9-e277cb5c0801","resolution":{"observed_at":"2026-08-11T19:15:01.483874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.871460Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"1f7edc03-b27c-477f-85bf-a857deea2e56","year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.487193Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:1271cdd6bdf03c715bfdc0b1acaef4b64f751b06ff79632eba8b8d4e3975d35b","observation_id":"62cb5589-cc16-4651-8208-925d80d296d8","resolution":{"observed_at":"2026-08-11T19:15:01.874377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.863568Z","title":"Natural adversarial examples","venue":null,"work_id":"59424bec-ed87-4571-86d1-21685ec96f32","year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.490407Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:9f3866c338187ca825b8140e5b6bcabbbd9e308d5f7197167dff58038a7af3b4","observation_id":"60e9411b-e350-4b4b-9af1-9a0b1dd8cbb0","resolution":{"observed_at":"2026-08-11T19:15:01.866133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.854846Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"48c23e1a-40ff-4835-9258-1f6f0fa973a0","year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.493115Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:aa8166bdb2b0452b4bca3f591a7792601764414791dca1e0fd7bbbe81a718542","observation_id":"38d5ba68-f305-458c-9ac6-847cc7fc5483","resolution":{"observed_at":"2026-08-11T19:15:01.858111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.845172Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"458a211e-9abd-42ec-89d0-a52b02cf4972","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.495968Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:3a28a303ceb6a251f620f06207ee958fdf3f3f078f5705fb347f0e9a41a93360","observation_id":"423036d9-767f-4dc2-aa17-71726b4b0275","resolution":{"observed_at":"2026-08-11T19:15:01.848420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.834654Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":"238c8677-eb03-41a7-a253-5a256003d726","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.499769Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:e497c13f3799827b8acf8aed3e058c9ee13d7c64fb83de73c0f173d7bf5834ee","observation_id":"51cc5428-ef90-4622-aa29-1803b4d7b41c","resolution":{"observed_at":"2026-08-11T19:15:01.838956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.503415Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.503415Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:f78fef5041d9bc5062415fc9bcf2e26d73ab6ceb823491af1216d198c0d67325","observation_id":"4b52f71d-6b2a-4a89-b546-62df55705fa1","resolution":{"observed_at":"2026-08-11T19:15:01.503415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.819581Z","title":"Read-only prompt optimization for vision-language few-shot learning","venue":null,"work_id":"75a290db-d6a6-43a6-9ad6-7e2934f95f89","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.506337Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:9a392ecc839443370cedd066d88d663cf477e51a43e8a52a8e6fea2eaa62dbd6","observation_id":"d36aa163-72c7-4d31-b55a-fe00e704b27d","resolution":{"observed_at":"2026-08-11T19:15:01.823515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.810272Z","title":"Prompt distribution learning","venue":null,"work_id":"9d336fa8-767a-40ee-ac69-9c33ff438841","year":2022},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.509164Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:2aac783ebafa36825075d6f7ae631a841224357d1bec3013148cc71342c63d83","observation_id":"23ac0879-9ab0-4aff-a32c-fbe5ea347c54","resolution":{"observed_at":"2026-08-11T19:15:01.813403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-11T19:15:01.512066Z","title":"Fine-grained visual classi- fication of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.512066Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:92c3763a28da346beb77700aeeed306aae5846e899bfc01b3866d47c00ec252f","observation_id":"8ca297be-0d81-4b6c-b2c8-c035dc486d80","resolution":{"observed_at":"2026-08-11T19:15:01.512066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.802284Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"c2e37ab0-ec7b-49c6-b67b-94d9ca4684bf","year":2008},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.515179Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:825197f31e6cdb31a0cee1d38216a797b96ffbec15bea5a3294b0af987f5281f","observation_id":"ad2346fc-b6f9-4190-8790-eb93949b6362","resolution":{"observed_at":"2026-08-11T19:15:01.805112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.792956Z","title":"Cats and dogs","venue":null,"work_id":"c6f4ebc5-443b-41c7-8a06-32fb063c9bb3","year":2012},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.517937Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:7bc18e800c7195e850ee76e1c8427235b97faaef38745307bc71b0daf6961920","observation_id":"da055f20-a870-4cc1-be0d-a6203e4692f2","resolution":{"observed_at":"2026-08-11T19:15:01.796319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.520873Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.520873Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:7376627cabffc32b7bb47c97d5d64f0b9f81839566fc4851165cc73fee571947","observation_id":"23caa507-d7c1-4975-b8ed-6376b3235eb6","resolution":{"observed_at":"2026-08-11T19:15:01.520873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.778633Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"0119b1d2-d2e7-43bb-b28b-ba7c95430b99","year":2019},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.523404Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:de8761354c906904293eeeb0ab22c89769299959ef5de65f2be74730de427163","observation_id":"acff5736-5a39-4470-82f9-e85c11ac42e4","resolution":{"observed_at":"2026-08-11T19:15:01.782106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.526502Z","title":"Do imagenet classifiers generalize to im- agenet? In International conference on machine learning , pages 5389–5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.526502Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:25f3c0a62e08fcf98be5a9c47c566c14ac3dc449f414f12045e5992677de0dff","observation_id":"51c5807d-4c73-4f13-b45f-e8577d60fc39","resolution":{"observed_at":"2026-08-11T19:15:01.526502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.760807Z","title":"Test- time prompt tuning for zero-shot generalization in vision- language models","venue":null,"work_id":"2641d22f-cd76-49af-841b-abb7c56c48d6","year":2022},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.529584Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:baf6873b0a619000762c379dec4ad3b4f6a96311c7d1da063d044e6d78d23149","observation_id":"6f7ca13b-6dce-4f06-8448-903e3e1c4333","resolution":{"observed_at":"2026-08-11T19:15:01.765174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T19:15:01.532398Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.532398Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:b3cf875d98fcebf0320fec75c91891daf10b10c3741062e103601e156b0bd12d","observation_id":"dfd6dc1f-388c-448c-bdd7-1721892264d3","resolution":{"observed_at":"2026-08-11T19:15:01.532398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05342","last_updated":"2024-07-07T12:19:37Z","snapshot_observed_at":"2026-08-16T13:36:26.704504Z","submitted_at":"2024-07-07T12:19:37Z","title":"Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2407.05342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05342","snapshot_observed_at":"2026-08-11T19:15:01.613591Z","title":"Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models","venue":"cs.CV","work_id":"f396b9b0-1d95-41bb-beb4-c9bbfef78ad7","year":2024},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.535063Z"},"links":{"cited_paper":"/paper/2407.05342","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:2e7f57430d25b0fd674f2fd3d7063fa4280e253fa9ccbd47cc10739f2c1e55eb","observation_id":"208105ed-955c-4f6a-ace7-931aa55521e7","resolution":{"observed_at":"2026-08-11T19:15:01.618638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.537941Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.537941Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:7da9ae7a2c3d40098d3ece31ea0bb942c5d32b14132cb6bda9b079f40a64d51d","observation_id":"c34fa859-efc2-42d4-bf95-8583f9480573","resolution":{"observed_at":"2026-08-11T19:15:01.537941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.745287Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"f9873686-0bcb-41ac-8b62-8fda4477a089","year":2019},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.540280Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:c887652d317c21c3793e38b5fbc06d16264239bc6f5057346403e88ec3eb1f07","observation_id":"68b64241-4894-4e80-bc8e-60e9967b2bb4","resolution":{"observed_at":"2026-08-11T19:15:01.748113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.737641Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"3c839c03-633f-4c5b-8773-8dc3e176d539","year":2022},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.542569Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:c4d704e7d4802293f936de1777e4e7a3953ec053c015f1037fc99bcb86940a58","observation_id":"642c6413-a3ad-437a-910c-bbc376d0ba6b","resolution":{"observed_at":"2026-08-11T19:15:01.740082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.729997Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"5ff954fc-a88e-484b-8ad3-162933a37153","year":2010},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.544838Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:33f93e933e1960081c4ba4ebb1526630cc3128e50cccf1f93888d51372791897","observation_id":"8b6e09ae-3743-487c-aee2-a4354822f870","resolution":{"observed_at":"2026-08-11T19:15:01.732754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.721206Z","title":"Visual- language prompt tuning with knowledge-guided context op- timization","venue":null,"work_id":"b11fc318-b572-4640-aa50-7c83da4193bc","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.546939Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:3def1f3ee1c9d2f1cba4be3826fb19b8b87743b0934fe56e3ea08630826325a7","observation_id":"30021335-0ea6-416b-aeea-20d3a97b9bb2","resolution":{"observed_at":"2026-08-11T19:15:01.724444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-18T13:50:47.418070Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-11T19:15:01.549245Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.549245Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:66ff92c67926d195e80ad6134642d275c599720001080b5a4f3b8ac91de69a64","observation_id":"76ffd2fe-4075-4158-819f-bfc6fad1f3d7","resolution":{"observed_at":"2026-08-11T19:15:01.549245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.711600Z","title":"Boosting continual learning of vision-language models via mixture-of-experts adapters","venue":null,"work_id":"fc13d031-4191-477c-8d94-f86100dc132e","year":2024},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.551579Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:b0d8c601e1766c7193afc670c5f79f104084142f7b9d1a2dc289a104d24eebbe","observation_id":"a2533971-2929-4e08-ae65-38ca0751bf6c","resolution":{"observed_at":"2026-08-11T19:15:01.715624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-11T19:15:01.553961Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.553961Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:016952edbe436799db1cb1e95822c9605b55f3a3c9582ec4573b617bea710528","observation_id":"8d4ded9a-9296-4efe-9bfd-42313019d6a3","resolution":{"observed_at":"2026-08-11T19:15:01.553961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.702329Z","title":"Barlow twins: Self-supervised learning via redundancy reduction","venue":null,"work_id":"4be54990-20e8-4fad-a6d6-e358e184c2d5","year":2021},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.556443Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:34e3ebe4d21e486aa32581dd2e9a35e78aa3c6ed99436ca854afe62adadd9846","observation_id":"64e81e4a-2288-40e1-a8aa-c7d49070cb3b","resolution":{"observed_at":"2026-08-11T19:15:01.705775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.558638Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.558638Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:36e5ab8d78b33201fb5fd13a48adbbfc33d0247369da9977c26247ce49708d46","observation_id":"e755b54c-298d-447a-83d7-f92cf7d6ae1a","resolution":{"observed_at":"2026-08-11T19:15:01.558638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.687494Z","title":"Preventing zero-shot transfer degradation in continual learning of vision-language models","venue":null,"work_id":"b8c409a9-9961-446b-833f-0ae4a60c8ae9","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.561511Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:34d9ac75ee505cec964e7aafc8241f0d08c5334234b92a57924bc10e02285349","observation_id":"e52d0da7-cd59-4771-8c0c-ede61a2aadf0","resolution":{"observed_at":"2026-08-11T19:15:01.691565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.679863Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":"ed023eb2-fa89-4d90-a2fc-6728e6c482d8","year":2022},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.564367Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:708290316af5d693b6e261e0e4ea1c5aff9fba359f87eaffd1355b0113aa8ee2","observation_id":"72f16287-c03a-439d-a70c-009016ec7640","resolution":{"observed_at":"2026-08-11T19:15:01.682333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.672221Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":"a580ae6e-3f8d-4676-973a-fe8ae1510e6c","year":2022},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.567282Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:4640630945da6c8b27a95056c93675fedb8a8697f7e8770ce6060d92c8ac72c0","observation_id":"79f3179d-fb58-4119-8506-1daac24e0640","resolution":{"observed_at":"2026-08-11T19:15:01.674695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:15:01.663791Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":"0a8b6160-3b53-4a9a-ab62-139c8dde6bde","year":2023},"citing_paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:15:01.570253Z"},"links":{"citing_paper":"/paper/2412.07077"},"observation_digest":"sha256:c2fa383da846a8abd1704f1dcf6ebd5458159569401fdd271bd8692f5db90fa4","observation_id":"ed3deae1-4db1-42d8-bc1d-b8bdf960d067","resolution":{"observed_at":"2026-08-11T19:15:01.666846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07077","last_updated":"2024-12-10T00:40:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:37:34.318179Z","submitted_at":"2024-12-10T00:40:31Z","title":"Retaining and Enhancing Pre-trained Knowledge in Vision-Language Models with Prompt Ensembling"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2412.07077."}