{"as_of":"2026-08-10T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f87f5e3d3ab9d075c73438c5488fdce323edee08072b21cf9965e4bc5aabe1d","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:37:24.063644Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:24:53.437554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13089","snapshot_observed_at":"2026-08-05T21:24:53.437554Z","title":"Glad: Generalizable tuning for vision-language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08812","last_updated":"2025-08-12T10:14:15Z","snapshot_observed_at":"2026-08-09T14:50:14.518696Z","submitted_at":"2025-08-12T10:14:15Z","title":"TARA: Token-Aware LoRA for Composable Personalization in Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:53.437554Z"},"links":{"cited_paper":"/paper/2507.13089","citing_paper":"/paper/2508.08812"},"observation_digest":"sha256:e14bd24765edb99ec74099ce7781086dafae9d1d23eb6bb00eb689e9d4f3463c","observation_id":"bd78f140-02f5-4e16-b878-6d00bf653a39","resolution":{"observed_at":"2026-08-05T21:24:53.437554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2507.13089","doi":"10.48550/arxiv.2507.13089","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13089","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ArXiv.org","work_id":"29d2ea58-dc5a-4525-aeac-4ed42dbc5f70","year":2025},"citing_paper":{"arxiv_id":"2604.14262","last_updated":"2026-07-01T10:12:28Z","snapshot_observed_at":"2026-07-12T20:25:38.300915Z","submitted_at":"2026-04-15T16:39:22Z","title":"GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T13:39:15.820777Z"},"links":{"cited_paper":"/paper/2507.13089","citing_paper":"/paper/2604.14262"},"observation_digest":"sha256:8959f8d30703fd8c41d93782ed7675e4bd6705439f56fe15698a03ba16ea5cb6","observation_id":"30255c27-ef3b-4a30-b360-43510c56f66e","resolution":{"observed_at":"2026-05-10T13:40:26.018918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13089","snapshot_observed_at":"2026-07-12T20:25:41.773345Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14262","last_updated":"2026-07-01T10:12:28Z","snapshot_observed_at":"2026-07-12T20:25:38.300915Z","submitted_at":"2026-04-15T16:39:22Z","title":"GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T20:25:41.773345Z"},"links":{"cited_paper":"/paper/2507.13089","citing_paper":"/paper/2604.14262"},"observation_digest":"sha256:ecac46be598d179fdc5aa1519127aff44cef91e01dab50f061a65d97333a8573","observation_id":"240109b8-82e3-4783-b64a-5230a8efe68a","resolution":{"observed_at":"2026-07-12T20:25:41.773345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13089/citation-record","integrity":"/paper/2507.13089/integrity","json":"/paper/2507.13089/citation-record.json","paper":"/paper/2507.13089"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:17.647963Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.647963Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:4f00dd1acc66bcd2e780e19ef29e446dd6973f55bb55f1783a04c899e2e70a77","observation_id":"8c631083-f522-4e07-a307-b4355579d76a","resolution":{"observed_at":"2026-08-06T16:37:17.647963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.637205Z","title":"Domain prompt learning with quaternion networks","venue":null,"work_id":"6b93b635-1226-4b90-bd1c-7b2b71887208","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.697297Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:33a3e2983b4d742b80fb459ab5c8117874db6c45b7bf9c03ca3fb0ca4f41ec9c","observation_id":"18c46557-4c87-4e5d-9b2b-23ae3baf775b","resolution":{"observed_at":"2026-08-06T16:37:28.642311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.623669Z","title":"Tokenmixup: Efficient attention-guided token-level data augmentation for transformers","venue":null,"work_id":"f65e171e-e9fc-48c8-8b2a-891fed538466","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.771183Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:8d9b8602b1bdc7d6c9925c9284731b7c31ffac05c6556216d4df84fe01badeb4","observation_id":"f5650e68-a17e-43f8-802b-123d6870fa79","resolution":{"observed_at":"2026-08-06T16:37:28.627929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:17.939549Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:17.939549Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d72f4e7babe78a2e6e0881f87a2f58dc6ef43971747e14cfd544790de8fec0d7","observation_id":"7ef1785a-36f0-40fd-9ea4-f5bb33dd768d","resolution":{"observed_at":"2026-08-06T16:37:17.939549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.599292Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"42683e04-9c7b-495b-b850-ca0e3783d5fb","year":2009},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.028779Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:5db8425344568857bb3701c5243acf177ed47d0feaa2c22c39e18460b463bd25","observation_id":"0ad76c32-0c90-486f-b8e4-3ea618b7fccf","resolution":{"observed_at":"2026-08-06T16:37:28.603846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.585530Z","title":"Learning to prompt for open-vocabulary ob- ject detection with vision-language model","venue":null,"work_id":"8a945263-6a67-4010-b3bd-30266c33a6f8","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.104529Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:25b71c46fb893574945945d58294c3dea47945981d90ed97075975eee0d01b92","observation_id":"92e68a92-edaa-4485-8bfe-43b4805b65ee","resolution":{"observed_at":"2026-08-06T16:37:28.589929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.569055Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":"3370ed96-d3a0-4056-ac26-f177b7b67279","year":2004},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.176667Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:ae1e68636a77dfb7db39298387ec9b56fc615fa5985ada0620aef338cb94ec8d","observation_id":"219ff661-2bad-498b-8dc5-b478deef58ff","resolution":{"observed_at":"2026-08-06T16:37:28.574755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.550624Z","title":"Prompt- det: Towards open-vocabulary detection using uncurated im- ages","venue":null,"work_id":"5863cf9c-d1de-4a74-8cf4-5c89c1c7a5dc","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.272795Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:827c36586cca51eed3726026359a088a38b138b553645dad0664034eb4a332aa","observation_id":"1cdbdb46-701f-4237-be09-1ffb4e5a7ad3","resolution":{"observed_at":"2026-08-06T16:37:28.555382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-06T16:37:18.401393Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.401393Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:1c9d0f32afcde91dfff931c8afb71c8d8f14992b79a7d9819a2073127ff81eb3","observation_id":"3123dc9a-92b4-4b59-a7cf-d4ce526c1dec","resolution":{"observed_at":"2026-08-06T16:37:18.401393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-09T19:43:52.666104Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T16:37:18.530702Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.530702Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:8280c7357475b0ac78e0d607a1f809c0f3116a5459ab21503a6943bd90e9da7c","observation_id":"062cd90d-afa2-40bf-b4ed-a5ecf1e1fef6","resolution":{"observed_at":"2026-08-06T16:37:18.530702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T16:37:18.616605Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.616605Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:2b28d90a0261856a9ae0c951f0becf5fc585f20399b4d699e4b221e3acc837da","observation_id":"c8cdf682-f7dd-47c4-8bd7-fa1559d24ea6","resolution":{"observed_at":"2026-08-06T16:37:18.616605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.535867Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"343a3b16-94b8-48f5-81f9-0e1cfff7a0f7","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.662303Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:783fce2d8640faa07b02235f79282f4705afb8e0f99f716f73b9b767aa6850b4","observation_id":"c557da71-b43d-4aa4-ad2c-953260e28b21","resolution":{"observed_at":"2026-08-06T16:37:28.540229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.520948Z","title":"Eurosat: A novel dataset and deep learn- ing benchmark for land use and land cover classification","venue":null,"work_id":"b41ed11e-b6cd-4f7d-9fd4-80c90adceef0","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.791568Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e44c9f84c9ed8d39b827bf1b9428cd8ea6da8b589ddd8dcd655a3980af788edb","observation_id":"6d2940be-bf72-4e9f-98a7-d6b6929d039f","resolution":{"observed_at":"2026-08-06T16:37:28.525518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.504833Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"6e27ab7e-75f6-4b7a-9275-2eb5739195c7","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.857488Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:20728e1e9ba388c10fa6c65608ad99206b4a5f2b95b545c769c6e953a866256c","observation_id":"f44a092f-0253-48bb-a48b-226d4d514e5d","resolution":{"observed_at":"2026-08-06T16:37:28.509559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.490870Z","title":"Natural adversarial examples","venue":null,"work_id":"15b95f89-6985-4d33-b870-bbb1ed3af7cf","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.963976Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e7a61deec24208671178862a38223e768321b1790e25361fd67a56d050635944","observation_id":"89a001d4-2771-45ac-b562-633982e981f0","resolution":{"observed_at":"2026-08-06T16:37:28.495020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:19.090863Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.090863Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:790b35fc30c44c2b1698d97cf606715769ed6d00f3b106c27ae0e99ddbb8464c","observation_id":"6b185be9-37b5-46cb-a022-c7019faad37d","resolution":{"observed_at":"2026-08-06T16:37:19.090863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12471","last_updated":"2022-05-25T03:50:23Z","snapshot_observed_at":"2026-07-06T13:13:40.650733Z","submitted_at":"2022-05-25T03:50:23Z","title":"Learning a Better Initialization for Soft Prompts via Meta-Learning","version":1},"cited_work":{"arxiv_id":"2205.12471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12471","snapshot_observed_at":"2026-08-06T16:37:24.735209Z","title":"Learning a Better Initialization for Soft Prompts via Meta-Learning","venue":"cs.CL","work_id":"6ec077dd-c2a4-4e7c-a9f2-87235743e4d1","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.243859Z"},"links":{"cited_paper":"/paper/2205.12471","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:db720a021222740fec844d52beee864a9a1d88d07870c1780c5b78988918aad1","observation_id":"00d50d34-2784-4f23-aa36-adebb894f1a2","resolution":{"observed_at":"2026-08-06T16:37:24.853475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05592","last_updated":"2022-10-11T22:33:14Z","snapshot_observed_at":"2026-08-01T12:26:03.140439Z","submitted_at":"2022-08-10T23:47:43Z","title":"Patching open-vocabulary models by interpolating weights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05592","snapshot_observed_at":"2026-08-06T16:37:19.347269Z","title":"Patching open- vocabulary models by interpolating weights","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.347269Z"},"links":{"cited_paper":"/paper/2208.05592","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:83695205a7d1b98b4a7acdf746a5ba938189f6a5335ba162b230889df835fd33","observation_id":"7f0920ef-a73e-4379-8f36-d74481668e8a","resolution":{"observed_at":"2026-08-06T16:37:19.347269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:19.448372Z","title":"Vi- sual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.448372Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:61c222c86481dde91e3388adc6f1cef7b63bebb8a012a4cce2c0951f06afa97f","observation_id":"5ff13c00-186d-45e9-97e9-fff6c9f2e3fe","resolution":{"observed_at":"2026-08-06T16:37:19.448372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.451306Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"31163fbc-cfa2-48bf-96ff-072a96454148","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.508974Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:bb083c5cf668ea8c3e7dd302194c8b89ca9abf7a12edd9bba214be2b420ab451","observation_id":"adf384f3-9ef9-412d-9a1c-73dffa930e01","resolution":{"observed_at":"2026-08-06T16:37:28.456352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.436129Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":"b0fb0e74-fd9b-46c1-9164-443e383ec9c3","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.619850Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:98f350d0b25e04620af3e2c9a4f2f75a70ad14505b6650b9ab2c89dd5ad8f7d4","observation_id":"d58f73ca-6225-4079-8f74-8bc9337af873","resolution":{"observed_at":"2026-08-06T16:37:28.440487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.420246Z","title":"Co-mixup: Saliency guided joint mixup with super- modular diversity","venue":null,"work_id":"1ff7c43b-85da-4e89-adba-c1a863880483","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.807655Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:0cd57c4e8567887f243ab421719447629d10162d39a85eae04cb0216b8475b5b","observation_id":"ec6763f4-2486-43f2-8d8a-cdec6d4795fd","resolution":{"observed_at":"2026-08-06T16:37:28.425528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:19.982942Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:19.982942Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:2235f909885ae1c1a1b9fcdc2cf0d1560003913da0062f41734d3dcda48b5f0c","observation_id":"5b63c5e1-dc1a-4444-a1e4-dd0c43ae81e3","resolution":{"observed_at":"2026-08-06T16:37:19.982942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.392295Z","title":"Read-only prompt op- timization for vision-language few-shot learning","venue":null,"work_id":"ae748853-22f8-4e05-b2bc-da934ad60e87","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.056213Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:83788cf9ea1abdc791a0ab05a5d7436797c887d2f404a629eddb8923024575d5","observation_id":"b57eb404-5fac-42f4-ada8-4ea5bff4d2d0","resolution":{"observed_at":"2026-08-06T16:37:28.396667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.376268Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":"b7507f42-3981-45a4-b5e2-16c79bd12ed7","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.165333Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c3ab8e47987fafa07fe59c7b635c96ccc7e43430ee5aadf545e13091e53931a9","observation_id":"8db438d4-ce38-4fc4-a3f7-f481a3744da0","resolution":{"observed_at":"2026-08-06T16:37:28.380993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.278857Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.278857Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d1cfc9eb715ac8ac89316944c4679ce803dfa8d9701bf61bce7b080a071e81b8","observation_id":"6825f01f-c45e-4115-805c-0a6b5cea8238","resolution":{"observed_at":"2026-08-06T16:37:20.278857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.463882Z","title":"Promptkd: Unsupervised prompt distillation for vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.463882Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d5dcb634befd0a91a2f4487f1cb38410b12d5e20e38006616a9a761b73404177","observation_id":"8d1fffa2-0021-4fa0-a42f-194812283d3a","resolution":{"observed_at":"2026-08-06T16:37:20.463882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.549960Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.549960Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:4ff86b02258579f9d747787d2bfab3ec655a41c3e3c743e13c3747ad161b585d","observation_id":"1db82ce7-f022-48a6-abd9-dca872383d73","resolution":{"observed_at":"2026-08-06T16:37:20.549960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.328651Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in nat- ural language processing","venue":null,"work_id":"5d40162a-5f77-44f0-8871-857d48e4dcd5","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.621651Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:82992955024019b5fa60fa28f4a00435c9084b11cdc454c1bb344a1656d5074c","observation_id":"a3d9f104-71f8-4166-86f3-088edfee8a7f","resolution":{"observed_at":"2026-08-06T16:37:28.333469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.313192Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"628884f1-5585-4d1c-beb5-b8668df7df56","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.716825Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:f1e4cc078a428e0d024ebaef2c42dda843647ab1a329db5bf704ea9d0470c35e","observation_id":"9afda434-7a57-409d-b40c-f35ca7b1eb54","resolution":{"observed_at":"2026-08-06T16:37:28.318282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.296590Z","title":"Prompt distribution learning","venue":null,"work_id":"74999d30-c465-49a0-ba98-e5af2e4dbfac","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.801162Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:36dcdd2c86db8203d90a4c9da16a16cdf3aed59df9f31b3081a692e0e59a6ae7","observation_id":"ba63cdc1-477a-44e0-b77a-aef4a4a45e5f","resolution":{"observed_at":"2026-08-06T16:37:28.302878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:20.912376Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:20.912376Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d1d879cae5aa091ef8b29f7787fc962f76bcf82b4f57665b84f6d3030d50cd27","observation_id":"24a22a1d-c2eb-4b73-ad51-a3ba60b337d0","resolution":{"observed_at":"2026-08-06T16:37:20.912376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-06T16:37:21.038250Z","title":"Fine-grained visual classi- fication of aircraft","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.038250Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:eb5d4150ddc59147b8c8285f5c73c3ea4ecb8a440874c29b44298fef4c862afd","observation_id":"a25130ff-2c5c-44c8-8ab4-ba7bad27944f","resolution":{"observed_at":"2026-08-06T16:37:21.038250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T16:37:21.189934Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.189934Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:0068a4fd531fc3b19bfda17c5b1cdb1e8587e3330fd050ab4f3557dc67705efb","observation_id":"5772af9d-23eb-449e-94e4-c3813760953a","resolution":{"observed_at":"2026-08-06T16:37:21.189934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16704","last_updated":"2024-05-16T16:44:11Z","snapshot_observed_at":"2026-08-05T14:42:34.010396Z","submitted_at":"2023-07-31T14:23:39Z","title":"Lookbehind-SAM: k steps back, 1 step forward","version":3},"cited_work":{"arxiv_id":"2307.16704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16704","snapshot_observed_at":"2026-08-06T16:37:24.485211Z","title":"Lookbehind-SAM: k steps back, 1 step forward","venue":"cs.LG","work_id":"b76e4352-5e3f-4bb3-838a-84bb50470e73","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.263196Z"},"links":{"cited_paper":"/paper/2307.16704","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:f17527b6c1b9e850ea69e674797e6baf4643a83582718c0db7c26aa89751d8d0","observation_id":"715a6811-a62d-4ac5-b41b-be757be0b828","resolution":{"observed_at":"2026-08-06T16:37:24.559955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.270734Z","title":"When does label smoothing help? Advances in neural in- formation processing systems, 32, 2019","venue":null,"work_id":"93cebf0d-3bce-40f1-8a06-7be94a20811a","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.345862Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:fdedb1a17d008f43e3021853a640e56b2cde07e2e71f8ff5008dd12c4a9e6fef","observation_id":"cea1fbff-c8c4-4478-bdc4-839e46f9c63a","resolution":{"observed_at":"2026-08-06T16:37:28.275633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.249957Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"53c02c77-3bef-48b0-887f-5b8d17206e93","year":2008},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.409595Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:90ea75c33852bd71ba05331e7b3078dc260ca306e3f16bde5d938d18759b76ea","observation_id":"cbe497ab-911b-43df-b53c-d286e638ee63","resolution":{"observed_at":"2026-08-06T16:37:28.255053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.235107Z","title":"Metropolis-hastings data augmentation for graph neu- ral networks","venue":null,"work_id":"438c937b-7218-4507-8b31-b5d9afef5ebe","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.560898Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:daac33a2aadf67a2e882cf6af8c31da320427465d7ad100614bb50f1a4a41a6a","observation_id":"50e15440-8eba-4475-8bd7-813569dbe26d","resolution":{"observed_at":"2026-08-06T16:37:28.239720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.220226Z","title":"Cats and dogs","venue":null,"work_id":"bafebbdf-a58b-4dd7-a8d6-06e9ba2835c1","year":2012},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.659196Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:fcbfc7d04e32ad7dc44668ee4f9cb233a0b6de3ff2d0976f286b8570599af3df","observation_id":"2dd8802d-63e3-42cc-8c26-ab2ba19371a3","resolution":{"observed_at":"2026-08-06T16:37:28.224586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.204951Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"e8a71f7b-2597-424b-a4b8-b4b277e76d40","year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.754468Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:e32e4bb9fa1335cc1bf1a50381d33d6ac0c990e3aebc3745543c2684682f2f41","observation_id":"4efa1e0e-858b-4470-91e6-cb0d0e004511","resolution":{"observed_at":"2026-08-06T16:37:28.209884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.187980Z","title":"Do imagenet classifiers generalize to im- agenet? In ICML, pages 5389–5400","venue":null,"work_id":"83b2d342-7fb1-435e-9bfc-dffb7baada1b","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.848212Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:5e1fd82f3905578997320ed98ce4442a95b901e6960ae01fa4067741ab14f0f6","observation_id":"f66149b4-eb02-46e6-bea3-8b47a049627a","resolution":{"observed_at":"2026-08-06T16:37:28.193331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15896","last_updated":"2024-12-06T00:41:15Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T20:15:31Z","title":"Multimodal Instruction Tuning with Conditional Mixture of LoRA","version":2},"cited_work":{"arxiv_id":"2402.15896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15896","snapshot_observed_at":"2026-08-06T16:37:24.285861Z","title":"Multimodal Instruction Tuning with Conditional Mixture of LoRA","venue":"cs.CV","work_id":"159fede5-3e90-47d4-8ee8-ed61a6e07841","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.969328Z"},"links":{"cited_paper":"/paper/2402.15896","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:69a4117fbd77badae8c6af1cea26ad30ee3ba2a185b36e66e2c28af82ad1466c","observation_id":"8ab4ee32-8f35-4cfc-b375-66f9e12e4cd6","resolution":{"observed_at":"2026-08-06T16:37:24.375379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.170951Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"fd61f563-b349-49bb-b3c7-f15b6845fc46","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.053563Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c5768564944afc1865805d0e4c9c29a00cd091a3fc872120b634bc705bcab7e1","observation_id":"15bc974f-d69b-4c6c-bbac-a30160cdad02","resolution":{"observed_at":"2026-08-06T16:37:28.175590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T16:37:22.126152Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.126152Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:2885720e0732adec481b7b29943fbe4c4a4511e11bc78f50b29e3e894cf31656","observation_id":"a6321269-a557-4ccf-98b8-5e6577c2a80b","resolution":{"observed_at":"2026-08-06T16:37:22.126152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.151504Z","title":"Dropout: a simple way to prevent neural networks from overfitting","venue":null,"work_id":"af754078-b770-4788-bdd6-7d958c1776f6","year":1929},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.207731Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c3bb0e35a2c751c87af925df8a2b68b66c4b9e2bb5659db06e138d0740d1f9e0","observation_id":"87838670-f2e1-4caa-8d19-a87cf28c806e","resolution":{"observed_at":"2026-08-06T16:37:28.158376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:22.304601Z","title":"Rethinking the inception ar- chitecture for computer vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.304601Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:12f762143d9ef0da58295e38234a6501d3420de3bec6147bd68bbf96b4c03898","observation_id":"64b15ba4-b80f-4605-8475-87b9d93f4409","resolution":{"observed_at":"2026-08-06T16:37:22.304601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.122456Z","title":"Saliencymix: A saliency guided data augmentation strategy for better regularization","venue":null,"work_id":"71a7c939-5137-45db-be06-e1c8bae307e2","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.449012Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:af01e3b4cc3ae12bd3621a751d140450f7ca85cb336b7267313c590a47ef9ee3","observation_id":"f35469ff-89a5-4ed7-97a5-5237913a7af8","resolution":{"observed_at":"2026-08-06T16:37:28.126994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.109263Z","title":"Manifold mixup: learning better representations by in- terpolating hidden states","venue":null,"work_id":"3ba04f39-f517-46aa-b042-f7a56f31b47e","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.547152Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d07fade1db2c396af1212cdb26d7373c87792e44dde54383b2207cea8dabd963","observation_id":"19d8d1bc-bc71-4e05-ba88-830e49bcec3d","resolution":{"observed_at":"2026-08-06T16:37:28.113352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:28.077907Z","title":"Tuning multi-mode token- level prompt alignment across modalities","venue":null,"work_id":"d25880e4-2536-425a-ba3c-bba3759e82fd","year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.642193Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:97eff7aa5e9fab0b15616140c94c9e4d12d4a31306c70cebf988f6c5c3ca718a","observation_id":"c0af567c-bd48-4819-a7cd-1d224f61e30c","resolution":{"observed_at":"2026-08-06T16:37:28.098342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.988015Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"5ef1f7b9-d3ab-48e5-8c3f-1052b4e4306f","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.737119Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:5b8dc9df79f20f2bb7eb5732705b17ee119bc8bd3b69acc7b90b209e9ec67d34","observation_id":"a9d23265-ea2c-46a4-b7c7-f71efadfa374","resolution":{"observed_at":"2026-08-06T16:37:28.066014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.804495Z","title":"Sharpness-aware gradient matching for domain generaliza- tion","venue":null,"work_id":"5cc5d379-c635-438c-a64b-c3f01cc4614b","year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.854498Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:ef000698b677aa69dca95b6fc8ab43e46b91bb86345b73da419297f731ffe532","observation_id":"c7bb7d1a-3b7b-46e3-8776-df01c172b0cf","resolution":{"observed_at":"2026-08-06T16:37:27.896307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.649130Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":"395e2cc1-a4af-43e3-862c-d6e95b236f50","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:22.959808Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:7a85b49c16f7af12cfbeb423f6b3162d7bf138f6538d7495502354984ec9cb2f","observation_id":"93c1dd62-3c84-4a36-bd81-82d3afda935f","resolution":{"observed_at":"2026-08-06T16:37:27.723422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.488899Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"6e2541e6-8b2d-4f48-83f5-eebca71ab928","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.033154Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:bfa76d3d07eec245b3f0f95886f656b1177e5036cbe2f17fc7abd3e0a9e78ff3","observation_id":"d3ea47da-5c28-4003-ba0e-dcabcfd057ed","resolution":{"observed_at":"2026-08-06T16:37:27.583409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.322936Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"52458145-43d1-40d9-a82c-b05551609de8","year":2010},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.079232Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:59635e8018440b4bb4861574eda044cb40ff4d0ad7c7d310968ffb119acf2a7f","observation_id":"26048ba1-384a-4013-ab3e-dc289bd39204","resolution":{"observed_at":"2026-08-06T16:37:27.403579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.151567Z","title":"Tcp: Textual- based class-aware prompt tuning for visual-language model","venue":null,"work_id":"eb07a785-c713-4745-8b98-a0ffd585de37","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.150721Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:68aaf94113245168082461d098b84b283ac95a1d6c71b4304483d19b83177182","observation_id":"35131259-a89b-4284-bdad-790893de0a37","resolution":{"observed_at":"2026-08-06T16:37:27.246670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:27.010021Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":"5e6ed437-4b3e-4b0f-a551-76f98bdcfe74","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.220423Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c15ff74c0e9140823254e68a40870ab0c77b3f8ef229118a69f774a1225d1664","observation_id":"3806585f-bbcc-4e70-be8d-2fde26295261","resolution":{"observed_at":"2026-08-06T16:37:27.078177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.839676Z","title":"Low-rank few-shot adaptation of vision-language models","venue":null,"work_id":"ca00d715-1601-403d-b7d2-ef7e2895fbcb","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.292963Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d72280d3e34012422605e4d6c72884b15e9b0ecbe1d829b0a7f070c022359415","observation_id":"ebfd872d-fb0f-49e5-88fb-d918115b5910","resolution":{"observed_at":"2026-08-06T16:37:26.915990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.706388Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"429133e5-86bd-4b25-93c3-1460be160e29","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.388218Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:8b2d9081d9b3bc9929753c54fec4d5cffb1193abba72519e5a3e94c5dda612e4","observation_id":"626eb206-3728-4927-90aa-835e1c098562","resolution":{"observed_at":"2026-08-06T16:37:26.763594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.520439Z","title":"Three mechanisms of weight decay regularization","venue":null,"work_id":"b628bc2f-f74c-486f-91e2-02364beac4d7","year":2019},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.425869Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:ecac877a660cd12405cb3f0f42c1b337fc937cfc9d5c10086a40f25a06a9b2b6","observation_id":"ed262ff5-852e-41f0-9a30-dbb356a79355","resolution":{"observed_at":"2026-08-06T16:37:26.620181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-06T16:37:23.459308Z","title":"mixup: Beyond empirical risk minimiza- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.459308Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:2441f2e7597ed40b34e0a90a113976eeb087c87b53bfcfd3835bf614ef194163","observation_id":"d28e2228-19a9-496c-8ffc-62e3c36aeeb4","resolution":{"observed_at":"2026-08-06T16:37:23.459308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.274970Z","title":"Dept: Decoupled prompt tuning","venue":null,"work_id":"a536b986-501f-4d2b-ba29-275c8b74afa6","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.526271Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:973982e3749fa5b81dfafcf7fbd34f6420f2ce3b743d5fd07bfd34396a7f4578","observation_id":"4834b420-d026-4e38-86e4-76b17aadee68","resolution":{"observed_at":"2026-08-06T16:37:26.426058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:23.593178Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.593178Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:1ca5695a21f2ab2bc294a845057ee55e3d1dfd2698ff057fc7493bd90f852b1b","observation_id":"a21fe1d1-d66b-4447-9f44-667a3af33382","resolution":{"observed_at":"2026-08-06T16:37:23.593178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:26.041456Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":"158ece89-2eeb-40f5-b60d-bcaf99601674","year":2024},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.638487Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:af5a160323878a1f20b8a1be7d65c9bc477f8592f2d8bfec141441548995a791","observation_id":"b7512f2a-6b89-4be1-b313-2e6847175b69","resolution":{"observed_at":"2026-08-06T16:37:26.126021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-06T16:37:23.687949Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.687949Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:f62e3e9a0bec2207dc8d67fe4287d1057f3cf0dea0ad81054ac634bbad5d4b55","observation_id":"c04e7633-c62d-43a3-ba52-725bb69e0a6d","resolution":{"observed_at":"2026-08-06T16:37:23.687949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:25.799425Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"ce207464-8943-4035-9fd8-7a3b562f7897","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.748806Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:fb37ff489e25d5d732fbc998f9b5ccb3902d52dba3d8094eab4031bc41a87736","observation_id":"2dadc935-ceed-472a-a3cd-822b7c5036d8","resolution":{"observed_at":"2026-08-06T16:37:25.879634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:25.434869Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"ca2b23ea-0201-4e3d-b66a-3c84c420d296","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.856095Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:8503d8b21b699f91c7ba282c54040cac8b2bb4a44e37e5d89c9843de91590ee5","observation_id":"7d993c5f-112d-4b83-b15e-97df888bc360","resolution":{"observed_at":"2026-08-06T16:37:25.618806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:25.096677Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":"587335d1-96ff-4b2b-a649-1aedb3e4a4d2","year":2022},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.927447Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:c9e420f1c7ad665488730d51bfc15321ce2982d35f4a827b20a80faed109ddf5","observation_id":"2cbf78dd-d784-4289-a2ae-135dcd884f41","resolution":{"observed_at":"2026-08-06T16:37:25.237348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:37:23.993559Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:23.993559Z"},"links":{"citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:1ce4ead0ff4e45f6d3c837eaeadca7889a070801031c3c18eea413bf204cef5d","observation_id":"e2a1921c-ccf8-4a8d-a30d-298f18332a4e","resolution":{"observed_at":"2026-08-06T16:37:23.993559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08065","last_updated":"2022-03-19T15:56:32Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T16:57:59Z","title":"Surrogate Gap Minimization Improves Sharpness-Aware Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08065","snapshot_observed_at":"2026-08-06T16:37:24.063644Z","title":"Surrogate gap minimization improves sharpness-aware training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:24.063644Z"},"links":{"cited_paper":"/paper/2203.08065","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:71eb0310c9ef73d27a190c337b9be5cfc88d50a304c8e0092b793437827e20c4","observation_id":"e9c866b0-7b5d-4199-be01-49ece54bf2c4","resolution":{"observed_at":"2026-08-06T16:37:24.063644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:44:13.690667Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 3 inbound Pith citation observations for arXiv:2507.13089."}