{"as_of":"2026-08-23T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8ad0aa58055cfdf6537c22031329535ff027496923cd0b288e9cd25512a5aae","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:34:42.355397Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T12:35:51.321835Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T12:43:25.937018Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2506.23822","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23822","snapshot_observed_at":"2026-06-29T12:43:25.937018Z","title":"Interpretable zero-shot learning with locally-aligned vision-language model.arXiv preprint arXiv:2506.23822, 2025","venue":null,"work_id":"65732448-b382-44d4-88df-dc31d80a5525","year":2025},"citing_paper":{"arxiv_id":"2605.28347","last_updated":"2026-05-27T11:51:25Z","snapshot_observed_at":"2026-08-15T04:45:33.467798Z","submitted_at":"2026-05-27T11:51:25Z","title":"FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T12:35:51.321835Z"},"links":{"cited_paper":"/paper/2506.23822","citing_paper":"/paper/2605.28347"},"observation_digest":"sha256:545d9f50bf36dc753d5f500d681e6376734d18d5b54ab6697a28a279f96d213c","observation_id":"603626a4-5abb-4478-a7a8-f87782c6921b","resolution":{"observed_at":"2026-06-29T12:43:25.938440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23822/citation-record","integrity":"/paper/2506.23822/integrity","json":"/paper/2506.23822/citation-record.json","paper":"/paper/2506.23822"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.276037Z","title":"Label-embedding for image classification","venue":null,"work_id":"e818b750-3d60-41ab-89e6-4e16b00ad883","year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.119515Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:9b9b02f10bf5b5a1e4273f2be9c1e679db77c0e800fe0c117af7ba852e59b0cf","observation_id":"40b413b2-a1a8-4381-a53c-ad456714f883","resolution":{"observed_at":"2026-08-06T21:34:45.278673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.267960Z","title":"Wasserstein generative adversarial networks","venue":null,"work_id":"69c75088-2f3a-455c-9126-88c494f3f39c","year":2017},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.187652Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:67df5ff8a69356cf8336d13a4fc942a8169b08ff65491ab9bbfe758d9d1a547f","observation_id":"f1f2df2e-7d76-4288-9f15-2fbd7e3a5a4f","resolution":{"observed_at":"2026-08-06T21:34:45.271135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.259853Z","title":"Food-101 - mining discriminative components with random forests","venue":null,"work_id":"9caf6745-b598-418e-816d-66677894a40f","year":2014},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.247061Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:3f99165c2697a0f04091f0c3617d11d2c38724be3f39832b82b853c3b8b2b193","observation_id":"97750993-608f-40eb-a06d-f943ac381e8f","resolution":{"observed_at":"2026-08-06T21:34:45.263407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.251733Z","title":"PLOT: prompt learning with optimal transport for vision-language models","venue":null,"work_id":"b3de842e-d7aa-4dec-8eda-738e40d58c78","year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.317911Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:bfba5db12ee6aa8f8c633ad3b2833f89705901d1adea8b55dc1f3e52ed267762","observation_id":"576058e6-045c-434d-9872-8b9873384dd6","resolution":{"observed_at":"2026-08-06T21:34:45.254621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.244487Z","title":"Hsva: Hi- erarchical semantic-visual adaptation for zero-shot learning","venue":null,"work_id":"87b52d39-edd0-4c71-aae7-a71e1719b1d0","year":2021},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.405260Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:85283dc79089757c54f675f3a5cf58d2d3cebb86c951d6cfb82160b9e79889c6","observation_id":"0d7687e3-e8b2-4e8e-9802-43069ae99510","resolution":{"observed_at":"2026-08-06T21:34:45.247518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.235602Z","title":"MSDN: mutually semantic distillation network for zero-shot learn- ing","venue":null,"work_id":"d4159367-affb-42b9-95f6-7ddd830dec5b","year":2022},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.491003Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:d7ff46af60dc0c674df49e4c5e6788e2e4a7e5695c07b5372175eef1e8537509","observation_id":"29e7a758-0192-40e3-939b-71eb25c0a6f1","resolution":{"observed_at":"2026-08-06T21:34:45.238807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.225218Z","title":"Transzero++: Cross attribute-guided transformer for zero-shot learning","venue":null,"work_id":"a11dbff8-08bc-4d87-8d7b-b301c9672f71","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.575798Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:c5a218486dd11f9e837b6465b8247bdcb5a9ac04729b43534090d928c0a7befd","observation_id":"8383f5d3-e207-49fe-9539-d36a81351640","resolution":{"observed_at":"2026-08-06T21:34:45.229905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.216455Z","title":"Evolving semantic prototype improves generative zero-shot learning","venue":null,"work_id":"05d40e4f-a6f0-4b7a-9c92-1b7a20b9c9ac","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.661869Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:a3d56753c7dbadbbf887c39329b5049d24929d8fce9d91a81db557be670406fe","observation_id":"bff84e56-9018-4421-a534-2207a90e60bd","resolution":{"observed_at":"2026-08-06T21:34:45.219668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.206884Z","title":"Khan, and Fa- had Shahbaz Khan","venue":null,"work_id":"ce094b57-0313-456b-a77e-e96752723f02","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.741203Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:08a79a6fcd3a05ff521af946ab2969788ddd6795457930eb242a149b6870b90a","observation_id":"c7705c4c-b248-4996-b224-f92f00091485","resolution":{"observed_at":"2026-08-06T21:34:45.210594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.200170Z","title":"Khan, and Fa- had Shahbaz Khan","venue":null,"work_id":"7a18e097-0195-43c8-90aa-964476934c74","year":2025},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.823129Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:f7aac91091c630db3a9e01cab3be7800acc51e5a2db58f9416e55e0cad113cfb","observation_id":"077d3ffe-47c1-4773-8831-a7c972902570","resolution":{"observed_at":"2026-08-06T21:34:45.202557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.192097Z","title":"Semantics-conditioned generative zero-shot learning via fea- ture refinement","venue":null,"work_id":"869e6b40-1815-4383-85e3-fa58a2980a80","year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.883354Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:446c4e562a5ef6fc7af1c6e3f115ed69ac1079e6c7048c1d964d4ddcfc4bb655","observation_id":"eae02ef5-81fb-4e95-9277-d48b3f25a511","resolution":{"observed_at":"2026-08-06T21:34:45.195108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.185919Z","title":"Evolving interpretable visual classifiers with large language models","venue":null,"work_id":"742174c4-5f2b-4dd2-8497-6d61b1dc55a9","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:38.966148Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:c111ec2560b58d71344aa78e1106e58fdc4e7e83f0e1f85c6edc32abaa084396","observation_id":"27ef409b-7c26-42f4-9ecd-c46a31848d96","resolution":{"observed_at":"2026-08-06T21:34:45.188074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.179020Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport","venue":null,"work_id":"86aebfb1-8d0c-45ee-a38f-81c0511d92e9","year":2013},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.058199Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:5ce41f122f0e87faeac85e3ab26ddbece5277b8d02596f22aff987f716bfa416","observation_id":"81d3dcfe-0038-4188-8425-43755b51664f","resolution":{"observed_at":"2026-08-06T21:34:45.181638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:39.128557Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.128557Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:6e202a9b35f607710e1d1187f0d1f904430d64b7b9a1c44d2d3849303f3e902b","observation_id":"aa7d2f61-7e30-4a7e-8c14-c6951c5f4b90","resolution":{"observed_at":"2026-08-06T21:34:39.128557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.166914Z","title":"Image2sentence based asymmetrical zero-shot composed image retrieval","venue":null,"work_id":"21ec9708-e8f6-4cff-a38d-2a7c0b8929f9","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.193778Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:0c68fb161ac86669d98f9861be6c545f8f2d6b964deb060d6a2702175ffdb805","observation_id":"46337fe5-7c4f-4deb-98b9-28ab3d0b1892","resolution":{"observed_at":"2026-08-06T21:34:45.170000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.160656Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"e5507f75-2bee-4787-82c0-8b2ff4d5345e","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.261986Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:d49566de44b78628b45ec78def8971322b16a25496c83d897379d79733559f2f","observation_id":"7f06d496-7393-4c0e-9191-4984a3db0337","resolution":{"observed_at":"2026-08-06T21:34:45.162692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.154668Z","title":"Diverse data augmentation with diffusions for effective test-time prompt tuning","venue":null,"work_id":"f728be33-7172-497c-9aae-7666c2035162","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.334243Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:1269650105959b97bf417fc79e8401d2e2a5c85d743914fe01aa355eea726726","observation_id":"50ff2b36-6f07-4d71-9e31-5881476ebcc6","resolution":{"observed_at":"2026-08-06T21:34:45.156722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.147964Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"254ab7fe-a8b6-4260-9a6f-77b824c8e881","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.412790Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:0d31138f39636680c5afe9afb3501ea55fbbae71950eac53d2cf2bb276ae9b99","observation_id":"8809b69a-0799-40fe-8cbb-979f50296397","resolution":{"observed_at":"2026-08-06T21:34:45.150383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.141394Z","title":"The many faces of robustness: A criti- cal analysis of out-of-distribution generalization","venue":null,"work_id":"c5c097a5-7189-45a6-ab33-251f38d1741d","year":2021},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.507419Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:13ae1cd4a77c8ab2b72d01d6d1603f18b0f64071cd4dc6f0b97ace8c8df35354","observation_id":"9ab5ffc0-fd63-4977-854f-19d5ad9495a8","resolution":{"observed_at":"2026-08-06T21:34:45.144076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.134757Z","title":"Natural adversarial examples","venue":null,"work_id":"a430b636-8ab0-4868-871b-e40697127631","year":2021},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.555060Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:ef5036b33443cdcc56b92724b13b48d7dd4554bde13df0af284bbfc1cd5895c4","observation_id":"38767e60-f574-4482-a15b-6f37d7592907","resolution":{"observed_at":"2026-08-06T21:34:45.136938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.128211Z","title":"Fine-grained generalized zero-shot learning via dense attribute-based attention","venue":null,"work_id":"0d09623c-2794-4397-84fc-e39ac8701831","year":2020},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.642698Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:83a8432254204a5de3875aca9b0a8fd78a84ba26922138d4f3eee5571d952ee9","observation_id":"ddb8f569-5c5b-46e6-9d7c-070499bb4da4","resolution":{"observed_at":"2026-08-06T21:34:45.131033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.119055Z","title":"Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"172926be-1f29-441d-9e0c-b3d09bafa7a4","year":2021},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.707291Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:39a962ad60f087cc68a615ba86b81b456ac1e0b126d594d515abe47b76934286","observation_id":"13a7fd2e-058c-4df0-bf02-afc81298e31b","resolution":{"observed_at":"2026-08-06T21:34:45.122621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.112502Z","title":"Multi- modal classifiers for open-vocabulary object detection","venue":null,"work_id":"130ae86c-44d5-4a7b-8846-f673a71df957","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.797286Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:1878b4369274c3a850c76b3a5acbdf01915b976aa29c9f8eee54c313b30fe554","observation_id":"92bce210-3093-4185-9b86-4de4fdcf0aac","resolution":{"observed_at":"2026-08-06T21:34:45.114989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.103627Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":"e9eb1263-38e1-47ce-a2a2-e2cb108f9db0","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.863413Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:d06080bdb879fabd9a38fcb78a1ce660faabfa9f22ebebc80af2c610adb4025e","observation_id":"d0d90183-cbbe-4849-97cb-536e4ce67108","resolution":{"observed_at":"2026-08-06T21:34:45.105812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.097572Z","title":"Kolkin, Jason Salavon, and Gregory Shakhnarovich","venue":null,"work_id":"11a54b96-af8f-4caf-b808-4809e212bf7d","year":2019},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:39.938287Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:1b20b127fb0dda72648be07876dc6fadee0d4cd33d63b3b26323e4ec80eae86d","observation_id":"ab8f1ad2-bcb2-4b5b-b43e-38fa875ee780","resolution":{"observed_at":"2026-08-06T21:34:45.099868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.091100Z","title":"Co-clustering through optimal transport","venue":null,"work_id":"e65fdbf5-3b34-4de2-a3ef-810efe2dcd0c","year":1955},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.037549Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:324a7dcb35f351f1f63607e3a12d03d555b39e314f24b652b0b97fd5b319e947","observation_id":"9bb93967-9739-474b-a061-785bb67415b3","resolution":{"observed_at":"2026-08-06T21:34:45.093614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.083045Z","title":"Visual-text cross alignment: Refining the similarity score in vision-language models","venue":null,"work_id":"04a9a1c6-a7c4-4d02-b0cf-d1f770e46977","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.126420Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:0fcff7c3afcb439ffb881e11687d0ad49ead93393b366ed3a978c8057d8613d5","observation_id":"ef2909ca-1805-4c29-aabf-46c241faaed0","resolution":{"observed_at":"2026-08-06T21:34:45.086316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.074564Z","title":"Patchct: Align- ing patch set and label set with conditional transport for multi-label image classification","venue":null,"work_id":"a2a477f7-f1ae-46f5-a30c-4f873c2eefdf","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.220034Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:94772e47238d84f807b389875d7279f1742e2f036ac12f9f14165ece9b6f5a0c","observation_id":"c06d7e7e-fb8d-4072-a48f-c264e7da6b5e","resolution":{"observed_at":"2026-08-06T21:34:45.076976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.066369Z","title":"Progressive semantic-visual mutual adaption for generalized zero-shot learning","venue":null,"work_id":"efd582dd-b606-4b69-9d03-4414359f19ff","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.310639Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:3ff30e1a233a4faf0831bf54b97bf1e3ffe5e7e99c0176c863c08d1b0e7213e0","observation_id":"f20368ac-095b-46c4-acc0-b067581ecdf3","resolution":{"observed_at":"2026-08-06T21:34:45.069234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.056753Z","title":"Visual classification via description from large language models","venue":null,"work_id":"5bad57dc-1736-4c7d-b30a-48e40112c9d4","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.396768Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:c664ceecbb063014e1a7cd610a0fbb15c9506dbedf77af686dd5aac67aba9891","observation_id":"b82a2603-7b41-4931-bbc9-e4a4baf1b5b4","resolution":{"observed_at":"2026-08-06T21:34:45.060118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.048403Z","title":"Robust calibration of large vision- language adapters","venue":null,"work_id":"d5915c65-1c24-4d3b-bc4a-a15dd3e98e87","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.490179Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:3c581c0494f72c5a50fc01c0ea56710a002a48e1b73598df6b09fabb70d35aff","observation_id":"56e367c0-2645-40ce-8f97-c362dcdfa37b","resolution":{"observed_at":"2026-08-06T21:34:45.051149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.041116Z","title":"Robust calibration of large vision- language adapters","venue":null,"work_id":"a5b16101-29ad-4456-b843-1952b500167e","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.558778Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:e8709288c5e6b0079a26d8f60f3f19916b77c3529d550c0e9c5fa3d9c2272839","observation_id":"fa8fd233-7fde-43f0-8449-f86d097fce3d","resolution":{"observed_at":"2026-08-06T21:34:45.043443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.033698Z","title":"I2dformer+: Learning image to document summary attention for zero-shot image classifi- cation","venue":null,"work_id":"6b255a16-8314-46fe-b6f0-59f1952f173d","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.637193Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:56c1fbc4326acc5686a7696480167e119c3274b07d7b20f3abc79628edb6b5f3","observation_id":"8d17f56b-fb2f-4ca6-a73e-680b06728d7d","resolution":{"observed_at":"2026-08-06T21:34:45.035914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.025802Z","title":"Pomerleau, Geoffrey E","venue":null,"work_id":"3e324387-d7b0-4353-bf18-dc471ad49440","year":2009},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.705915Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:b5d15012ea883b610d39ebf3df825a8cebf85c9639c6731084e5bacc2b34dd59","observation_id":"d003a31f-4eb8-4d97-a58e-14dda1893eee","resolution":{"observed_at":"2026-08-06T21:34:45.028313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:40.802004Z","title":"Parkhi, Andrea Vedaldi, Andrew Zisserman, and C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.802004Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:584cf9777d32f638d10461247251f7e7680fc3e7989445c410dc67777807225d","observation_id":"3195ebc4-ff21-4ccd-b9c5-a254b9ce0073","resolution":{"observed_at":"2026-08-06T21:34:40.802004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.014250Z","title":"Computational optimal transport","venue":null,"work_id":"a6dfdc58-b4ee-47a5-8847-30428fd7a1ac","year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.874839Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:9bae5391a9fd60a150d76867df22540f5754688494e1f3a64f29739e8c4b58b2","observation_id":"c1f54dfa-500b-4d0f-ac6f-ddad495d6bb5","resolution":{"observed_at":"2026-08-06T21:34:45.016913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:45.006049Z","title":"What does a platypus look like? generating customized prompts for zero- shot image classification","venue":null,"work_id":"a9c3af70-c6ea-482d-a10f-1ac30f87eb07","year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:40.951345Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:f36d391c00986c13ea232fc43ed2f0930cff0f961bc9120b31aa5313c6b4cb62","observation_id":"d1dac71e-820d-4434-9b06-e8cfc6c5e08c","resolution":{"observed_at":"2026-08-06T21:34:45.008948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.999787Z","title":"Pratt, Ian Covert, Rosanne Liu, and Ali Farhadi","venue":null,"work_id":"2b5d7f81-c052-4b84-8509-d3ae133346ac","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.030911Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:ee06cb979a1b1897b8b3cec57fab39654671fbe9c462d98f06a5ef6a5c80ea51","observation_id":"f60793b9-96d0-4e32-b84c-f2101a735e61","resolution":{"observed_at":"2026-08-06T21:34:45.001796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.898260Z","title":"Proapo: Pro- gressively automatic prompt optimization for visual classifi- cation","venue":null,"work_id":"ad02250f-b37e-4795-a489-eb11f6138373","year":2025},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.106333Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:02d2e6e0b15f586b46475c5981b57420ab1ba69f1214aa2b4597269030f30181","observation_id":"fd36e31a-c486-459d-9cb9-207a2557eadb","resolution":{"observed_at":"2026-08-06T21:34:44.995071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.762603Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"292f3acd-54e1-4358-b522-eed12669f3f2","year":2021},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.181037Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:d7198bf6af9dcdcc58d11fe9eb22712901603db97eb1c8e3891ea76f38f8312f","observation_id":"e54bfc82-2d2c-4346-be19-9de2a842179a","resolution":{"observed_at":"2026-08-06T21:34:44.838610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.620162Z","title":"Do imagenet classifiers generalize to im- agenet? In ICML, pages 5389–5400, 2019","venue":null,"work_id":"869d13d0-5052-41c3-b276-befaf915e65e","year":2019},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.234392Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:b13e38f7cfcd591768f55787e719c1053ecb7d6f0aa6eaee7fed631159563a5e","observation_id":"64c9ff44-6c22-4dc3-a3eb-c742f18e01f0","resolution":{"observed_at":"2026-08-06T21:34:44.700283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.482992Z","title":"Sophia Koepke, Oriol Vinyals, Cordelia Schmid, and Zeynep Akata","venue":null,"work_id":"16b82a49-6522-460a-b5f3-05efed29c21a","year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.319904Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:f0cec04e27fd1a6a96b60778e37ac411340a1208bd011cbef84a93f62c58a9a7","observation_id":"a62323ec-9ffd-4390-b42a-8b970de10065","resolution":{"observed_at":"2026-08-06T21:34:44.539090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.475492Z","title":"Generalized zero- and few- shot learning via aligned variational autoencoders","venue":null,"work_id":"d09d4d2f-4ef3-4061-a907-d013e8f18461","year":2019},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.409051Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:37b4da1b02faa3ac9cc21229921b98e8cc88e34a093e941b6bc1b2a2d64cd75d","observation_id":"294ff7c5-fa3f-48b9-877d-b075229d6aa9","resolution":{"observed_at":"2026-08-06T21:34:44.478190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.334387Z","title":"Test- time prompt tuning for zero-shot generalization in vision- language models","venue":null,"work_id":"52241bec-9723-4a5b-82e1-5634503ede20","year":2022},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.455920Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:e5a8c61203a8e8beb004a310056163818fbf992df5c4be786cc0a3c142c4b00a","observation_id":"84644f33-3bed-47f6-bb0d-5eac2285653a","resolution":{"observed_at":"2026-08-06T21:34:44.406486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.128629Z","title":"Hunting attributes: Con- text prototype-aware learning for weakly supervised seman- tic segmentation","venue":null,"work_id":"cc20ffd9-1c98-4332-9271-98d6864b3995","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.521708Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:eceedbb2f19376ad33ea032577c1eecae7853b4cb3d1c3f7e799c2ebc48b6602","observation_id":"1d6d6c11-3c33-47ce-a64f-16ac96086f80","resolution":{"observed_at":"2026-08-06T21:34:44.185725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:44.003334Z","title":"Argue: Attribute-guided prompt tuning for vision-language models","venue":null,"work_id":"221c22ca-c03a-40cb-9fea-d6d6cab8ee0a","year":2024},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.582088Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:5596f82c647bf26ff02aa57739b947de93cf6b8e709d75dad261170dc5931aa8","observation_id":"30ee8ef2-1c23-438c-84f7-946459cbd1ef","resolution":{"observed_at":"2026-08-06T21:34:44.058181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:43.954647Z","title":"Tuning multi-mode token- level prompt alignment across modalities","venue":null,"work_id":"a4338385-aa8b-4383-8cb3-c06723a6200f","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.646705Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:ee4198fdca89f84834af6d2d707d04e1b52def90cd27cf5b71bd2ebef509ed1f","observation_id":"fc5846fe-897e-482c-b385-8c54c2b36623","resolution":{"observed_at":"2026-08-06T21:34:43.960764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:43.945935Z","title":"Lipton, and Eric P","venue":null,"work_id":"410562ee-6741-404e-a8a8-6991a7e36da7","year":null},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.728611Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:3e2aa993682c573d74de5084babdd214c527b7a817aaea33e57f64ec4c1cab55","observation_id":"bf6e56df-5db3-401f-bc4e-cfcb3777d3a7","resolution":{"observed_at":"2026-08-06T21:34:43.948255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:43.754232Z","title":"Zero-shot visual recognition via bidirectional latent embedding","venue":null,"work_id":"38f373ca-e328-4ea1-a09d-9855645a1a99","year":2017},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.814733Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:f12f440bd13932c230373752c573eb5181c88a36c14df1ab08b978441a575083","observation_id":"65327196-1cb1-458f-922b-861af002a7c9","resolution":{"observed_at":"2026-08-06T21:34:43.858773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:43.546953Z","title":"Welinder, S","venue":null,"work_id":"639976dd-d337-46a7-98f5-03aa3255ac4a","year":2010},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.883185Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:ba981943fba806a2933ae4ac1f791a123179b111bf0556e19962331974009f8a","observation_id":"f8ff87f1-fec1-4ec5-a183-362e6082e662","resolution":{"observed_at":"2026-08-06T21:34:43.640489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:43.354363Z","title":"Schiele, and Zeynep Akata","venue":null,"work_id":"382e999b-ff26-4ab3-ba58-ff8b3ede7fcb","year":2017},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:41.964125Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:464168c973ab59ef1bb1daf6cd49b88cdd5eef6f1632523a69af17db57b095fc","observation_id":"028b4ce2-dfe8-41a6-929b-f19f062ff9da","resolution":{"observed_at":"2026-08-06T21:34:43.462090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:43.132840Z","title":"Lorenz, B","venue":null,"work_id":"93491cc1-c1cf-45cc-a8c5-e50e1362502c","year":2018},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:42.010840Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:2e09b45e69d5d8b834f62e06ccf5e3e1abae5ef7b46781ae6f9c014f6711822f","observation_id":"5128ea2a-be29-476c-b3ac-1f4fd8f29558","resolution":{"observed_at":"2026-08-06T21:34:43.236837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:42.918896Z","title":"Khan, Zhiqiang Shen, Muzammal Naseer, Guangyi Chen, and Fahad Shahbaz Khan","venue":null,"work_id":"415cde22-0d24-41ec-ae4e-e2b68ff02d08","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:42.098251Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:4e766180f841373071ff94d3e78f10f4914bff142ce881b14a22f2c9378ba1fd","observation_id":"de7ada3a-90ad-4bf3-9832-02e5e8230e77","resolution":{"observed_at":"2026-08-06T21:34:43.015907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:42.705754Z","title":"Places: A 10 million image database for scene recognition","venue":null,"work_id":"4d2858d0-2bd8-4e89-9ef4-e395bdfb81c8","year":2018},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:42.165157Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:9c6281419445c8ee4416c6fdda1b339ba02f4f0ca7257f1501e7e60a8a7f8249","observation_id":"7c075e03-1d4c-4391-a993-57253318aabe","resolution":{"observed_at":"2026-08-06T21:34:42.831883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:42.682689Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"f5f5df77-2438-4007-893e-15e56dba8a65","year":2022},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:42.232511Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:e1dd7e5c7dbe89bfde91dcb28b2feaf3b6e7b35e49bc0009e7bbfd0e4933a0a6","observation_id":"55fef51c-db4c-490a-907b-361581c2074d","resolution":{"observed_at":"2026-08-06T21:34:42.697098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:42.525396Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":"9b716460-d0dc-479e-852b-88e610a09eee","year":2022},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:42.300495Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:4b0c5a1af8e5df2a906679ed2b747fdfbca0c3cd96c6b4559d2db52aaee62f04","observation_id":"30a63017-5af8-4e64-ac96-eb058b7cc3cb","resolution":{"observed_at":"2026-08-06T21:34:42.577356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:34:42.433029Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":"6106ce79-2749-48d1-bfa5-fed2dbd37c57","year":2023},"citing_paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:34:42.355397Z"},"links":{"citing_paper":"/paper/2506.23822"},"observation_digest":"sha256:37e7e97295ebf08f41f2b1ddf0c67e989233ec012b5917fcd965693e9f0d61b7","observation_id":"3530d133-5caa-4089-924a-4d0abafedcb5","resolution":{"observed_at":"2026-08-06T21:34:42.478926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23822","last_updated":"2025-06-30T13:14:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T22:38:02.850549Z","submitted_at":"2025-06-30T13:14:46Z","title":"Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.23822."}