{"as_of":"2026-08-10T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0dfc3758bde654e0f38e70411f2ce2aebc71dc5310eaaee68308af706753cadc","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:14.795852Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T22:07:35.021986Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T22:09:07.132811Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2604.16678","last_updated":"2026-04-17T20:21:34Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T20:21:34Z","title":"UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:32:36.729122Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2604.16678"},"observation_digest":"sha256:a23687c57f5a1befc44cbd31d88a2c9b4b7ec91bb7b9bc79761d85ce6a5a5f91","observation_id":"d62736ac-a819-41bb-a7c7-eb0abf546778","resolution":{"observed_at":"2026-05-10T08:32:52.003486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2604.21343","last_updated":"2026-08-04T21:50:05Z","snapshot_observed_at":"2026-08-08T23:09:28.589207Z","submitted_at":"2026-04-23T06:58:08Z","title":"Latent Denoising Improves Visual Alignment in Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T23:07:54.806529Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2604.21343"},"observation_digest":"sha256:d1b6c0af2a54186b9e6a1fc830c49ac16810363ccd94a30c883d1d8bd706063c","observation_id":"a3fff1ec-2d20-4ddc-ad54-cc96cf462af6","resolution":{"observed_at":"2026-05-09T23:09:26.700458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2605.13161","last_updated":"2026-05-15T18:29:50Z","snapshot_observed_at":"2026-08-08T13:57:13.822691Z","submitted_at":"2026-05-13T08:24:55Z","title":"A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:14:03.809826Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2605.13161"},"observation_digest":"sha256:8f198f665fb27b025bd5095e1aebea085f460db8f06ca09e1f817ba9cc15d498","observation_id":"5b84b43d-5e64-4629-a595-4b924cbc06b4","resolution":{"observed_at":"2026-05-14T19:17:51.075371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"cited_work":{"arxiv_id":"2506.02557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02557","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel-based unsupervised embedding alignment for enhanced visual representation in vision- language models.arXiv preprint arXiv:2506.02557","venue":null,"work_id":"8af49f39-384f-4ad9-932b-9e17c1f299ca","year":2025},"citing_paper":{"arxiv_id":"2605.13161","last_updated":"2026-05-15T18:29:50Z","snapshot_observed_at":"2026-08-08T13:57:13.822691Z","submitted_at":"2026-05-13T08:24:55Z","title":"A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T22:07:35.021986Z"},"links":{"cited_paper":"/paper/2506.02557","citing_paper":"/paper/2605.13161"},"observation_digest":"sha256:03557aeb4a06dcf193ffd994c76caadf09a1f85fe81ebec9f7f335d1b4c60450","observation_id":"885178fa-8e7d-4394-a495-a60a3a927002","resolution":{"observed_at":"2026-05-20T22:09:07.135657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02557/citation-record","integrity":"/paper/2506.02557/integrity","json":"/paper/2506.02557/citation-record.json","paper":"/paper/2506.02557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.076810Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.076810Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:85f1759bbd269e555eec8df0be1c4ca54d5b5ec536860a72fa3b512ac6d8818a","observation_id":"4d16e6ee-d894-4bda-8dcc-7acfeb66ae2e","resolution":{"observed_at":"2026-08-07T11:26:13.076810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-06T18:01:31.723021Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-08-07T11:26:13.168645Z","title":"and Li, Y","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.168645Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9a70c269ebeafdd05c00f38bb3171a4fcd4b5550a2df748f599a355ed5e6438f","observation_id":"9ac6405e-c393-4fe7-be5e-44e9302a72b6","resolution":{"observed_at":"2026-08-07T11:26:13.168645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.268183Z","title":"Multi-label cluster discrimination for visual representation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.268183Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:3b313df6c018ed51648aceeee82e596ff5224c018fded55a33e901f46c2a4a96","observation_id":"5b8e08a7-39c5-472a-bf0b-f4305a43ef72","resolution":{"observed_at":"2026-08-07T11:26:13.268183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T11:26:13.323907Z","title":"W., Ilharco, G., Wortsman, M., and Schmidt, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.323907Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:bbe8658902fcdbd85eae7313d8013078d8009e04d73e939067397609ea9d6e72","observation_id":"dd2aea2c-c9b9-4bd1-894b-5ac1d6191e03","resolution":{"observed_at":"2026-08-07T11:26:13.323907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:26:13.361069Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.361069Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:e9c87f7c4009360d5288b9493d1b558b414578824e156f43a74f363682fd602b","observation_id":"ae69c505-1c92-4049-8542-abc0a16de6f6","resolution":{"observed_at":"2026-08-07T11:26:13.361069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.366454Z","title":"BE it: BERT pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.366454Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:46a7c505fb1a270b2c56233f40f72268fbb243ce5ceba040f301302b94489715","observation_id":"93b3c931-1656-477b-91ee-e9678554b1ea","resolution":{"observed_at":"2026-08-07T11:26:13.366454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-07T11:26:13.372034Z","title":"J., Arbel, M., and Gretton, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.372034Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:709db19a3a99bf0beddc124f89e82308df127585e31a1c95025542762ba0245e","observation_id":"15631b84-da0c-4158-890f-8af4e5d2f0cf","resolution":{"observed_at":"2026-08-07T11:26:13.372034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.379895Z","title":"Domain prompt learning with quaternion networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.379895Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d2f3559bbfa9d731c5d0b7a4dba404149c1d0c7c4d9f8034af2d16bc63c51847","observation_id":"687fedb5-d726-43a1-a2cd-2cb12ad73329","resolution":{"observed_at":"2026-08-07T11:26:13.379895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.388470Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.388470Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a16d9cdf2912f767c093d513f094ad08c4b441f201c9f8dd029cf742b8bfaec9","observation_id":"18af799d-c07f-4a26-8766-b41a6ea96b33","resolution":{"observed_at":"2026-08-07T11:26:13.388470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T11:26:13.395742Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.395742Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:7c62ccc570605fd16f7a45e122aa449d1f686b7c798f845cdbe3843972642f10","observation_id":"4ae0c78d-9be3-4ee3-84a6-54fc288609ed","resolution":{"observed_at":"2026-08-07T11:26:13.395742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.404320Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.404320Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:3cc44cc31391bed00d152b63c58f9b8e28c7a744185ab3607a698cf80d6ee93e","observation_id":"5bc761d1-b06c-4caa-a25b-ce9284b1b416","resolution":{"observed_at":"2026-08-07T11:26:13.404320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.413877Z","title":"Remote sensing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.413877Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ae561730f1fb0f7a8c0aa85fe40635cbca7a3bb760a1a79c6bffca64b1fc1650","observation_id":"9aa90695-3be6-400e-943d-09083641276e","resolution":{"observed_at":"2026-08-07T11:26:13.413877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.424318Z","title":"Describing textures in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.424318Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9c13c05532ef2a13a4f295147df0eb9acc1a576e8ee5392d5962bdc658352cb2","observation_id":"2bc4a2da-efac-488c-a0ec-b5892fa02b4a","resolution":{"observed_at":"2026-08-07T11:26:13.424318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.433254Z","title":"Locality alignment improves vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.433254Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:f410b4659db8013ca7c6097c4e412bfc6b8264aa80695ec3e6f92d361ae41aa1","observation_id":"01f684b7-2458-4e0c-844a-5c245287180d","resolution":{"observed_at":"2026-08-07T11:26:13.433254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.442273Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.442273Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:291c49109915b776dfe66211a106bc978ab10875357fe3dbc18177fdd80b2079","observation_id":"9ea5f798-9654-40d3-b615-2e300fe98c8e","resolution":{"observed_at":"2026-08-07T11:26:13.442273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15593","last_updated":"2024-05-16T20:51:13Z","snapshot_observed_at":"2026-08-04T22:40:00.783785Z","submitted_at":"2024-03-22T19:41:26Z","title":"FairerCLIP: Debiasing CLIP's Zero-Shot Predictions using Functions in RKHSs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15593","snapshot_observed_at":"2026-08-07T11:26:13.449072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.449072Z"},"links":{"cited_paper":"/paper/2403.15593","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9ff27ad69a7c9cef1e869ad1e02a21036fdfe278833310175f8fa4095cc3c2c8","observation_id":"76f1de1f-3955-4271-956b-0e71f1f8478a","resolution":{"observed_at":"2026-08-07T11:26:13.449072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.458149Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.458149Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2e07d69bdecc2e55bb0edc545b3c6ccc57e31a6dda2e5c2675730e94bf0336ac","observation_id":"29001f20-7d10-4a44-aa2e-3a212bc2928b","resolution":{"observed_at":"2026-08-07T11:26:13.458149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-07T11:26:13.466593Z","title":"M., Jain, A., Schmidt, L., Toshev, A., and Shankar, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.466593Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2e1c4cd5a7efd46d21be8df4dcda8be22b328348a32ef4585ccb7e7c0b27019e","observation_id":"0f19e8af-fdf4-4222-b513-e6808e566af5","resolution":{"observed_at":"2026-08-07T11:26:13.466593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.474213Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.474213Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0682443a485bbd33204934522ba88e0a9c19d092d029615d5305e8c277964af7","observation_id":"e1768fd8-cc1c-4a4b-8fb5-cac422a01f1c","resolution":{"observed_at":"2026-08-07T11:26:13.474213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02410","last_updated":"2023-07-02T22:58:51Z","snapshot_observed_at":"2026-08-07T23:25:34.011944Z","submitted_at":"2022-10-05T17:32:16Z","title":"The Vendi Score: A Diversity Evaluation Metric for Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02410","snapshot_observed_at":"2026-08-07T11:26:13.482039Z","title":"and Dieng, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.482039Z"},"links":{"cited_paper":"/paper/2210.02410","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:58bf4ef4280f03d03aaa1c69f9bbe9ebc0f29e2af9173669d2da54e48861bb51","observation_id":"f27885c4-874f-4f66-80cd-ca21c6c67bfc","resolution":{"observed_at":"2026-08-07T11:26:13.482039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.489672Z","title":"Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.489672Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:4092792d4c90c193d642ccbaab943d2937428b0c3f9bd097370492fd31a097d5","observation_id":"fe8321d5-a764-48b8-9d49-79270960917b","resolution":{"observed_at":"2026-08-07T11:26:13.489672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.498808Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.498808Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:b513a0a914fdf7d465c0b73aee254be8a9b498287a25ba269e6047fc332e13c1","observation_id":"5e9ed5a2-454f-4ca2-afc6-0660046e0e4a","resolution":{"observed_at":"2026-08-07T11:26:13.498808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.507737Z","title":"3dsam-adapter: Holistic adaptation of sam from 2d to 3d for promptable tumor segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.507737Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:77d1dd97a2b8ab7c1e437f26486a70bd1c00fbae469a47c42d592cabe47e96a0","observation_id":"01bb1b83-88d7-447e-a6f6-e6d5055328d6","resolution":{"observed_at":"2026-08-07T11:26:13.507737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.514659Z","title":"Boosting the visual interpretability of clip via adversarial fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.514659Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:f290054755e1249d34bd45c5a9fd086028d9c2937604a6b5720f2cc7269b489e","observation_id":"1b00e8df-c653-435c-8b8a-207190ba5e94","resolution":{"observed_at":"2026-08-07T11:26:13.514659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.523302Z","title":"J., Erhan, D., Carrier, P","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.523302Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:cd8b42ec244b5b94f68d20311fc3e8f3a6b048d97eb8aa9320f873c4648eb233","observation_id":"d9c80418-3b83-47c1-9d71-9fe959274c87","resolution":{"observed_at":"2026-08-07T11:26:13.523302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.531936Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.531936Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8f02f0538d09930e1df8efea86e94196ad245d2a05987fe5309800e8efb58840","observation_id":"6930017c-288a-4408-b09a-498b9b8db2e4","resolution":{"observed_at":"2026-08-07T11:26:13.531936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.543285Z","title":"Recovering low-rank matrices from few coefficients in any basis","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.543285Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:dac157ce5a18bda66fe3f1d9ea2ce57d7815d1423d66c9041e5d8f246834829b","observation_id":"f2ecbac2-a02a-4822-91ae-6e21c4010444","resolution":{"observed_at":"2026-08-07T11:26:13.543285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.317070Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":"72c23a8a-0cfb-42dc-81c4-0259dfecc73f","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.551090Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d8a391a3c8d71577bb57702cb91e451c62dc4661759c7d330daf3beb5beeb28e","observation_id":"366ffc2e-2196-4e70-8d5f-1cc98c69c510","resolution":{"observed_at":"2026-08-07T11:26:16.322547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.559218Z","title":"J., Guo, A., Lin, C., Grauman, K., Luo, J., and Bigham, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.559218Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9390902cd89f05d7095993ffe9a7d46bb6c73e02e50f35b47754101c68517eba","observation_id":"3a7fc68b-0e04-4eca-a9b0-df2e2203c2b7","resolution":{"observed_at":"2026-08-07T11:26:13.559218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.288284Z","title":"and Ozay, M","venue":null,"work_id":"1cce4c87-dcd5-4170-b8db-8f4a56411f95","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.569083Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:246e5943552f39601ed06cc636fd18ab0db1afa276541b984f8ac90ddb0a8e72","observation_id":"b69abfb6-bd6c-44df-9b2b-e0d23c980b20","resolution":{"observed_at":"2026-08-07T11:26:16.293617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.577818Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.577818Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:c4f5a0e07fc4ee3857c9ca2c1021977ea35d9411202336020a9404dfda52cc2d","observation_id":"121c676e-fa5f-48ad-9c50-690fa20805bb","resolution":{"observed_at":"2026-08-07T11:26:13.577818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.256944Z","title":"Introducing eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":"1de5cb4e-7c60-4e6c-a242-b5273142b0ac","year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.585481Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:839d164b01432ab12fe70c0eb530e87de165794bc106369926c845799bb98297","observation_id":"2a254a0e-9dcf-4e16-949a-9b1c1abc6c1c","resolution":{"observed_at":"2026-08-07T11:26:16.263624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.239151Z","title":"Natural adversarial examples","venue":null,"work_id":"52284d61-ae33-4532-b414-6666b46bd857","year":2021},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.594682Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8374caaecc37d88efa6c4e38a024f09e4a5e4a8413b6621163b916d33453cf26","observation_id":"4d7b9426-0970-4aae-b9d7-3d9b4b0597f1","resolution":{"observed_at":"2026-08-07T11:26:16.245014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.218091Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":"af97c45c-a3bc-43c2-9b6e-e2e526f355db","year":1994},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.603893Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:003dc77ed67b5b83651f458e86508077618d8f2f52b2f512cfe74a55328951fe","observation_id":"cf580be8-ad12-443a-9c32-81712a0531de","resolution":{"observed_at":"2026-08-07T11:26:16.227681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.197156Z","title":null,"venue":null,"work_id":"0485fceb-bdeb-4082-a617-1489076ce5bd","year":2008},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.611022Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a13f95936e376e4a7dec615ddd31ecc7f09b590be0ab7adcb41efc35998e4a9c","observation_id":"4416e393-5b99-45c6-9ea9-dba6335057b2","resolution":{"observed_at":"2026-08-07T11:26:16.203710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.622913Z","title":"J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.622913Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:897be210f757ab4cb00cfd968f8dcd6e83a0e93f0716d4b22b80551607b13cca","observation_id":"dc363e2b-3006-4734-a536-73a19962b57a","resolution":{"observed_at":"2026-08-07T11:26:13.622913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.167053Z","title":"T., and Farnia, F","venue":null,"work_id":"c78a0e97-9818-4f05-921e-d40c8cf71a10","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.629823Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:05fff6288f7d3f99feab6e6f332953ba88a46bb077384319eb5985cc015d7786","observation_id":"ec4452a5-ec39-44de-b667-91adde54424a","resolution":{"observed_at":"2026-08-07T11:26:16.171988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.149916Z","title":"T., and Farnia, F","venue":null,"work_id":"f1a6f4dd-0493-4103-9c7d-6b85f6895493","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.639656Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:cb7fd52130b93db986cf3f68d2d531f6a8076ea92edcc8027502a8b727129925","observation_id":"eae863a3-ed91-4854-9112-b5ceaa723332","resolution":{"observed_at":"2026-08-07T11:26:16.156234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-07T23:37:32.488201Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-07T11:26:13.676257Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.676257Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:75ecd5098506a7d8f35b75b965bf84a5488e6cc4fb77111cde390cda537054bc","observation_id":"dbba5313-2aad-4768-8d8a-e44aa9ffa657","resolution":{"observed_at":"2026-08-07T11:26:13.676257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.131375Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"0f483acb-b058-451c-aab7-a59b085f29f5","year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.710170Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:914cb587089331706c7f7cdea3cad1c651016eb5a4b3d57ac3b9b016b7e296d8","observation_id":"206e2dba-54a7-45c6-8e8b-d3e48972387e","resolution":{"observed_at":"2026-08-07T11:26:16.137088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.113107Z","title":"What's ''up'' with vision-language models? investigating their struggle with spatial reasoning","venue":null,"work_id":"a152050b-a0e6-46d0-9fa7-9f87bbc8380b","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.745597Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:58934c3a189a6cc1af27ab60a8a3c2f2c511bfd02c11ce709fe78ce00eeeb4a8","observation_id":"ad4df0c3-f888-4b8c-81b7-7cf62eae08cc","resolution":{"observed_at":"2026-08-07T11:26:16.118412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.769979Z","title":"Studiogan: A taxonomy and benchmark of gans for image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.769979Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:5c5bbfb7693c5692be82336ebe5251e2f01256e5bee696427cb0ae9a0b8f1796","observation_id":"bc348745-03d8-4a07-95c6-203ae6f6619c","resolution":{"observed_at":"2026-08-07T11:26:13.769979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.090774Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"bf6aa123-f25d-48fe-99ff-620bd6aa5047","year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.788031Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:7c119725b78261c7cb4301131edafa4b668e5a6e847909bee4d99bdfa8f92a3b","observation_id":"e2a1764d-f340-4029-ab33-673f15dd52c5","resolution":{"observed_at":"2026-08-07T11:26:16.098644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.070817Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"fedb54ba-8c95-4131-b30e-2d9ee346ebb3","year":2016},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.814240Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:fbfb9c20a2d8d7b84d34c20d16bde2664e948796436c1d0357d34f1ee94a9e4d","observation_id":"fd87e030-16f8-4a32-8da4-d7c713a2ebcb","resolution":{"observed_at":"2026-08-07T11:26:16.076987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.052860Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"dc603fac-627d-43cf-b703-61a2f6e2a091","year":2020},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.852337Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a41cb35918aa28ac82251dedd59a4bd844d8a57b2023f28b1dee954b6e8742cb","observation_id":"1d4571e4-a51e-4c97-a34b-51d71ddfc5ed","resolution":{"observed_at":"2026-08-07T11:26:16.058144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.878916Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.878916Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d77c4499210179ed56ca38cb79e4966fb1c8911f831d2a9a067954f23cfc6fd9","observation_id":"4f904f8d-1662-4281-94b0-c76d3ac765c4","resolution":{"observed_at":"2026-08-07T11:26:13.878916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.897490Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.897490Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:f1325e8f50ef61070cf96e9b86cb24b8c4065f6c9efe0307cd498f48e7747e73","observation_id":"da99cb35-99f2-40e9-b0d1-58ece4309242","resolution":{"observed_at":"2026-08-07T11:26:13.897490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:16.013091Z","title":"Clip benchmark: Clip-like model evaluation, 2022","venue":null,"work_id":"0479cf7e-c89a-471c-bb82-cdb8159164c2","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.931847Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:a68df76e9d7e4465c058acfe9369b6cd97a19f10807ddbb6b784d39f1457b82c","observation_id":"fdc3bc36-8274-4109-a257-e0b499b0d560","resolution":{"observed_at":"2026-08-07T11:26:16.019546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.958430Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.958430Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:36ad2965f17c3d160178f3f73f9cc5bd4abd96f1dcd75344049193619fb7fedf","observation_id":"986ea017-a1a9-423e-a162-80aa191b2015","resolution":{"observed_at":"2026-08-07T11:26:13.958430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.982085Z","title":"Transfer learning in computer vision tasks: Remember where you come from","venue":null,"work_id":"eb3534ee-a2ce-437e-93f2-66e9123e4687","year":2020},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.985748Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8b1dc89f1e9d2ecad400e8b9fba1bf2309fc45a20882e6eaa729134571ae27dc","observation_id":"ab00bb5c-ea22-4fe4-b469-420a53fd3470","resolution":{"observed_at":"2026-08-07T11:26:15.987195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.965606Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"072a9eeb-122c-4a00-9504-99f3b3b6ed01","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.022976Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:b43a8e2d7f92b5aac317ae04f92a14b6e8f3c57dda420b127a61eb17dcb373f0","observation_id":"0e1a228a-284d-4834-acf0-c75ca3829e9a","resolution":{"observed_at":"2026-08-07T11:26:15.971091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.058425Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.058425Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:c2ee42d3b21f232735e096362fafbd397d3468e26997a5b3459f72a6820859c3","observation_id":"b55b8aa9-9a3c-492d-85ad-173108fd5013","resolution":{"observed_at":"2026-08-07T11:26:14.058425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.937894Z","title":"Visual spatial reasoning","venue":null,"work_id":"7169488d-758f-4ffa-b0e3-09b7596a4368","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.093939Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:902741eab33453e6aea00656d39eede9a3cbfb24015ec62360dd8ce03b8ad5e9","observation_id":"941bbed5-eb97-4269-8ad7-47c1f58e61e1","resolution":{"observed_at":"2026-08-07T11:26:15.943536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.130078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.130078Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:b1b7c32057a35b56c6ae575ae650715fc1f7f9a9e68da8b7ba18ea3bf8f801d6","observation_id":"95581358-a2dc-4a8f-8e01-5f39a1289963","resolution":{"observed_at":"2026-08-07T11:26:14.130078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:26:14.157884Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.157884Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:de43053b18d90cae30bec8e51fae79bd4c41763aed0e1df02e143004abd1572c","observation_id":"ad658fa4-a1d9-4e11-88d2-2c6fa4d826b1","resolution":{"observed_at":"2026-08-07T11:26:14.157884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07016","last_updated":"2023-04-21T17:08:27Z","snapshot_observed_at":"2026-08-02T07:43:21.690977Z","submitted_at":"2022-12-14T04:08:56Z","title":"Understanding Zero-Shot Adversarial Robustness for Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07016","snapshot_observed_at":"2026-08-07T11:26:14.191544Z","title":"Understanding zero-shot adversarial robustness for large-scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.191544Z"},"links":{"cited_paper":"/paper/2212.07016","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:cbf1910c45d7059581e714d90dc4b6d4fa63713e11ce0a7df3f139a37632ca7d","observation_id":"2b9b5496-ad13-4cc1-b52b-2c82d1c81616","resolution":{"observed_at":"2026-08-07T11:26:14.191544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.214004Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.214004Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:57fea8feb1555c40382c194397664cca2139b404b472a11a7defa5fcf6b12840","observation_id":"97d40f26-43b0-4ba1-b6c8-bbf546f4a1d4","resolution":{"observed_at":"2026-08-07T11:26:14.214004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.234636Z","title":"Y., et al","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.234636Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:7765cdcec414d6f1e1d631dd7f54740da8cf871f4a5769fad4d6dd591aa894ba","observation_id":"53d26859-b591-4ff0-8722-4807ae2a4770","resolution":{"observed_at":"2026-08-07T11:26:14.234636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.888167Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"fa611790-5255-4373-a7ba-f4c51d716755","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.250170Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ae086a8dbb3a59b66bf06ad28351a4a2a8bcd8e1101e56674ca87f9570511e06","observation_id":"76527488-a35d-443a-aab9-e2a81759f282","resolution":{"observed_at":"2026-08-07T11:26:15.894122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21719","last_updated":"2025-06-24T07:25:00Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T04:19:41Z","title":"Do Vendi Scores Converge with Finite Samples? Truncated Vendi Score for Finite-Sample Convergence Guarantees","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21719","snapshot_observed_at":"2026-08-07T11:26:14.272780Z","title":"and Farnia, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.272780Z"},"links":{"cited_paper":"/paper/2410.21719","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:1c6e28f8ce26dac065a6bbcb5bfd835a05a75943a990e1c55ed53e9bb82907c4","observation_id":"dcf1e64b-a01b-4377-bd5c-3489b89a64c3","resolution":{"observed_at":"2026-08-07T11:26:14.272780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18645","last_updated":"2025-08-03T06:19:26Z","snapshot_observed_at":"2026-07-06T20:12:59.152345Z","submitted_at":"2024-12-24T18:07:57Z","title":"Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings","version":3},"cited_work":{"arxiv_id":"2412.18645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18645","snapshot_observed_at":"2026-08-07T11:26:15.075739Z","title":"Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings","venue":"cs.CV","work_id":"efbc86d2-0202-4e95-afa6-c4af29d3c96b","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.289306Z"},"links":{"cited_paper":"/paper/2412.18645","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:adc8782e18d385c26ca1a088099dc0f814fb5ad1d2b03f72f5e8f4660740f200","observation_id":"1a5fae69-ee38-41bc-b5dc-14c10c800486","resolution":{"observed_at":"2026-08-07T11:26:15.081496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.869791Z","title":"Towards a scalable reference-free evaluation of generative models","venue":null,"work_id":"f0e2168f-263d-4155-b2e7-9975e83e8146","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.310303Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d069ffee3e8b130a83c0a9f8d092e43c5f8a3b84bab833fe1f06df70a9b0a1a9","observation_id":"74d19f35-21aa-471d-910a-247e7ee840c8","resolution":{"observed_at":"2026-08-07T11:26:15.875218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.852452Z","title":"M., Vedaldi, A., Zisserman, A., and Jawahar, C","venue":null,"work_id":"c232b0d6-9851-481b-8872-d3a9d38f0b3e","year":2012},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.315818Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2c7aba2ace3d580138f456dcec9c13b93536ae62eb4024e384b31c9e0499ec5b","observation_id":"43bac356-ca4d-42a1-81aa-2d9b908b5fc7","resolution":{"observed_at":"2026-08-07T11:26:15.857821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.327491Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.327491Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:393d4911d20adca08fc35b4ee4467cc9f28a07d770cd2211575768e63016e4a6","observation_id":"2618be62-08dc-4987-b436-f6c8b8b33a5d","resolution":{"observed_at":"2026-08-07T11:26:14.327491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.821757Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"6ba64ff3-31e7-4acc-89ae-899af5ddb9b7","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.337840Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:75f64870b1b93cac29fd67ad9528bb5b9e57970aa97773ba9f7f86498561f9ff","observation_id":"36b7853d-b122-4b04-98f4-4a8a043db632","resolution":{"observed_at":"2026-08-07T11:26:15.828165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17622","last_updated":"2025-03-22T10:45:56Z","snapshot_observed_at":"2026-07-06T20:12:13.548098Z","submitted_at":"2024-12-23T14:48:17Z","title":"Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms","version":2},"cited_work":{"arxiv_id":"2412.17622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17622","snapshot_observed_at":"2026-08-07T11:26:15.051605Z","title":"Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms","venue":"cs.LG","work_id":"d5e5a225-d161-4fb9-9d26-46915e86704c","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.349429Z"},"links":{"cited_paper":"/paper/2412.17622","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:6d125ccbe43703d916bcbf3f1f3eb0eddd206667885a562c62310983f61c9fb4","observation_id":"918a3279-df71-4ef6-937d-790a1d9df14b","resolution":{"observed_at":"2026-08-07T11:26:15.058806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.803677Z","title":"Improved zero-shot classification by adapting vlms with text descriptions","venue":null,"work_id":"d034fdb7-8900-4ff4-ae5a-9c0c2868483f","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.362400Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:05317fbe0d0ed17a272b2d575a1ca3cded25dd2ae5153994f755be938404b77e","observation_id":"6ac9159c-f5d3-405d-81b3-fcf795583ee8","resolution":{"observed_at":"2026-08-07T11:26:15.809295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14108","last_updated":"2023-10-21T20:20:13Z","snapshot_observed_at":"2026-07-06T16:36:35.423639Z","submitted_at":"2023-10-21T20:20:13Z","title":"CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement","version":1},"cited_work":{"arxiv_id":"2310.14108","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.14108","snapshot_observed_at":"2026-08-07T11:26:15.029417Z","title":"CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement","venue":"cs.LG","work_id":"b2004c85-0b70-4f90-be20-d3121b063902","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.375483Z"},"links":{"cited_paper":"/paper/2310.14108","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:79f56d4b11a995a6c41847e00244f226eabe1f5e74f50ca0835b3ec605123cd3","observation_id":"4e5c131a-6d20-4eff-b873-ca932678061f","resolution":{"observed_at":"2026-08-07T11:26:15.035097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-08-09T23:45:31.392277Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-07T11:26:14.409174Z","title":"D., Croce, F., and Hein, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.409174Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:3de674964bcd760bfd562aa8d57e6cbcb3bee2e0aaa429309035e539f696d436","observation_id":"ebf584df-d99f-4edd-a28a-dc9ee716d36c","resolution":{"observed_at":"2026-08-07T11:26:14.409174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12709","last_updated":"2024-07-17T16:31:38Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T16:31:38Z","title":"MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12709","snapshot_observed_at":"2026-08-07T11:26:14.425638Z","title":"Mome: Mixture of multimodal experts for generalist multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.425638Z"},"links":{"cited_paper":"/paper/2407.12709","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:c9e02d1c9952d7f9cba4ee757bc82d16740ce4f350e81b5f20fc5ccc69cb0658","observation_id":"b6b6a7b7-2294-4b70-ba5a-04f1a26dbd1c","resolution":{"observed_at":"2026-08-07T11:26:14.425638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07604","last_updated":"2024-03-15T08:42:39Z","snapshot_observed_at":"2026-08-10T08:11:15.712191Z","submitted_at":"2023-11-11T05:40:54Z","title":"Finetuning Text-to-Image Diffusion Models for Fairness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07604","snapshot_observed_at":"2026-08-07T11:26:14.450325Z","title":"Finetuning text-to-image diffusion models for fairness","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.450325Z"},"links":{"cited_paper":"/paper/2311.07604","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ff5b8b1ead5e3b7611b0e81bd1f85328e354083c7a9dbc17bb02db385f47cffc","observation_id":"73f02e0a-268b-47b9-8f9d-0ec95bc9ce56","resolution":{"observed_at":"2026-08-07T11:26:14.450325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-07T11:26:14.486555Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.486555Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8b83940caf9add086be9e3d5351a955929d403e981529908fa7832d880f41dc4","observation_id":"5efff50b-5682-40c5-b5d9-0ed382beb549","resolution":{"observed_at":"2026-08-07T11:26:14.486555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.514075Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.514075Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:fb31de5afdcd57057a2d6efcff78d0c40b8cb90ed37c7d33b8826be67d4a665d","observation_id":"86c03fab-1dc6-414c-9dd9-3cf325655264","resolution":{"observed_at":"2026-08-07T11:26:14.514075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.773349Z","title":null,"venue":null,"work_id":"5f0c0560-b194-471b-b3f1-ccb83fe6777b","year":2012},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.532330Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:5eeb3b0c2846e291086bd18bffe868396b01120082344b4db2f91b5b1704b0c3","observation_id":"d5eeb4e4-5a06-4026-845f-44b8f6fe2d19","resolution":{"observed_at":"2026-08-07T11:26:15.779942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.752328Z","title":"L., Taylor, E., and Loaiza-Ganem, G","venue":null,"work_id":"6fa451af-ae43-4b8e-bebd-97b459e0188b","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.567592Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:60a1c4c841ae5c8f317bd11e051942656b21533b5f451457105f2bfd9100a919","observation_id":"a43fc90d-4703-49a7-8e49-220310d8585c","resolution":{"observed_at":"2026-08-07T11:26:15.758280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T11:26:14.595926Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.595926Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:92b965b796669107899e34e890628b52f0287a9f256f385703c726b9bc71f14d","observation_id":"92360aea-3301-4b3a-8ae3-14ba88afdfd5","resolution":{"observed_at":"2026-08-07T11:26:14.595926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.734810Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":"968a7ac1-500e-41f6-bed4-8078b4d9c36c","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.633074Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0794db7ba78c461ec8c601ed61af117040733eb7116abff92adaec0073f2ba9a","observation_id":"75fce3a4-6058-4509-a68a-2ce192512d2d","resolution":{"observed_at":"2026-08-07T11:26:15.740074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.668972Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.668972Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8ef81500e08bc8832cc4f910c8e71f5fdbb1bea33d8cfade6cf99e8844335620","observation_id":"8a11379d-27de-4437-81c4-d11d76d335b6","resolution":{"observed_at":"2026-08-07T11:26:14.668972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.703004Z","title":"S., Linmans, J., Winkens, J., Cohen, T., and Welling, M","venue":null,"work_id":"ca78e726-3952-4a76-8c3a-316b84bf6d35","year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.688699Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2c101d81f3693cd5265598787189c5c81e302beed7707618d01e67f051e014f2","observation_id":"8958d4da-88b8-4d83-a640-75d27891eb51","resolution":{"observed_at":"2026-08-07T11:26:15.709139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.684638Z","title":"Clip the gap: A single domain generalization approach for object detection","venue":null,"work_id":"6d010d63-1605-449d-9209-ad966f309f80","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.693990Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:161445e0d906f8b9d0d96740a814f2d02a73823e821d5e7b756cb80d39bf67b5","observation_id":"bd473008-39b0-4582-86b0-9cf57d3e5756","resolution":{"observed_at":"2026-08-07T11:26:15.691181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.667650Z","title":"S., Steiner, A","venue":null,"work_id":"720f25f1-6e43-4e41-adb8-94ec020fd84d","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.699343Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:efaac4430ce86c6f3b4ea9797a59433e24a0cfaf0476f752f79ffdeac2212833","observation_id":"e5740819-6d52-4e95-8a60-38da9a6d39f4","resolution":{"observed_at":"2026-08-07T11:26:15.673241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.650884Z","title":null,"venue":null,"work_id":"d31aeecd-a1f7-468f-83bc-9469a48e7571","year":2019},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.708069Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:960a843ebed2cb83ccdec8c861cad20aa7e00b3accca5ff647f8476822fab8fc","observation_id":"b7a586b6-5dc2-43c8-bc52-d27d87f85af7","resolution":{"observed_at":"2026-08-07T11:26:15.655991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.633995Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":"cf39d2c2-f0d9-4131-8a08-9c53e643ea11","year":2025},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.714678Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:08df512cd41141a1c268bd4c1bbb4ae96516644dadbf1323be424466c4482e21","observation_id":"65186142-1aa3-4919-9f62-ca235b46f4c6","resolution":{"observed_at":"2026-08-07T11:26:15.640372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-05T20:11:45.942545Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-07T11:26:14.720443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.720443Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:c39f347cd7470c90d3982cce5ea269bbc2cc0f73389c15435d1a23531d9e50b0","observation_id":"62d63c46-d754-4f26-828f-ce1d23533941","resolution":{"observed_at":"2026-08-07T11:26:14.720443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.617980Z","title":"Demystifying CLIP data","venue":null,"work_id":"285d62c3-466d-4546-98f2-15ab62a3d5e1","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.725923Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ad47b8219b66cb59a4d248a0c7a13790b768ebfd2dbea25250d9ba8fc918d220","observation_id":"a43c192a-2ac7-447c-a69d-9cc493a6cfcf","resolution":{"observed_at":"2026-08-07T11:26:15.623105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.600225Z","title":"Explicit inductive bias for transfer learning with convolutional networks","venue":null,"work_id":"05fe1663-8dc7-4197-b339-52b2fbe65c11","year":2018},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.731229Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2b4295089c84fbb1d911b0b26a501c77974592962cc94d1c2c475b3185ea1180","observation_id":"c367537a-4415-49b2-9169-6420db8b0cea","resolution":{"observed_at":"2026-08-07T11:26:15.606495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.581923Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":"42621d01-0fe5-4838-b18f-bd1efc24dd70","year":2014},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.736867Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:f7d18bc74097bdee19dad5c7ed8a92b5ad0108b65f00378f4c133e545abebc32","observation_id":"984b5b48-16a6-4047-ac45-5dbea0e582a2","resolution":{"observed_at":"2026-08-07T11:26:15.587517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.564946Z","title":"C., and Berg, T","venue":null,"work_id":"006590b0-8562-4102-b9b9-73e9cae7b176","year":2016},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.741696Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:e6da480c9a51813921c803c8afc33d98c72a506d59cc219ee99e934a57be64dc","observation_id":"a6135983-a5c7-4bad-a1fd-8200c9309782","resolution":{"observed_at":"2026-08-07T11:26:15.570210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.549146Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip","venue":null,"work_id":"d2f48b5f-38eb-4367-95a3-30a22ab43221","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.746368Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:0f195af70faf23e4dec98f81e99f535b7cfba6fc700c10c3bf475e2ef6fa8934","observation_id":"74155806-e21b-4baf-881f-117b867164ee","resolution":{"observed_at":"2026-08-07T11:26:15.554372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.533063Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations, 2023","venue":null,"work_id":"010234fd-e363-4619-90f2-f592505deae0","year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.752572Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d23fbb2f307c5f28afa580d52f30cfd22d9495a5c22acc4250315783faa8f0a6","observation_id":"215a7a43-1c7f-4c53-bc74-17924b037985","resolution":{"observed_at":"2026-08-07T11:26:15.538506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.757778Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.757778Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:d64835ec59ac63cea0ee6c6c913b0930ddc98ddda55ffa5dd09395db4e8e32ef","observation_id":"2cb6e895-9f87-4c8d-8c4d-69b22d6ba8ec","resolution":{"observed_at":"2026-08-07T11:26:14.757778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02700","last_updated":"2025-07-15T03:34:56Z","snapshot_observed_at":"2026-07-06T18:09:51.117905Z","submitted_at":"2024-05-04T16:06:50Z","title":"Unveiling Differences in Generative Models: A Scalable Differential Clustering Approach","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02700","snapshot_observed_at":"2026-08-07T11:26:14.763166Z","title":"T., and Farnia, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.763166Z"},"links":{"cited_paper":"/paper/2405.02700","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:ac0525a5bb3259db1ae992b0b8e846c15325128720f85eb98444e7af624e8f39","observation_id":"4bfa7c29-6693-46f8-b2ca-bd214c111d9c","resolution":{"observed_at":"2026-08-07T11:26:14.763166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17287","last_updated":"2024-06-14T01:37:57Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T08:00:52Z","title":"An Interpretable Evaluation of Entropy-based Novelty of Generative Models","version":2},"cited_work":{"arxiv_id":"2402.17287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17287","snapshot_observed_at":"2026-08-07T11:26:14.864246Z","title":"An Interpretable Evaluation of Entropy-based Novelty of Generative Models","venue":"cs.LG","work_id":"0f33a635-0b23-4444-aefd-dc7e7ff8bdfd","year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.769062Z"},"links":{"cited_paper":"/paper/2402.17287","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:8c01f8f86c97dfb790d018167f1877cf7d2926a33943da05fc10aa1fa106c641","observation_id":"f147c74c-a66a-443c-a7e1-333c75204a53","resolution":{"observed_at":"2026-08-07T11:26:14.871675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.504189Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification","venue":null,"work_id":"5ccd2e73-0470-4bbb-b598-90bf17be2156","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.774232Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:9918c331cce6030227a10a991a848bdeaa10e98205cf471566b492fe103487f6","observation_id":"dc3159f4-8721-495b-b9dd-4cb65b7c68ef","resolution":{"observed_at":"2026-08-07T11:26:15.510047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:15.484352Z","title":"H., Zhou, L., Dai, X., Yuan, L., Li, Y., et al","venue":null,"work_id":"436bada9-a6b4-4370-a545-590f7374c03d","year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.780451Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:2d8217ba2373675d722cdb2d4e6384a6cc14a753dbe757b77003e6e1855d1856","observation_id":"bd3c76e1-ac43-4256-a6c3-cb6b3b7ec446","resolution":{"observed_at":"2026-08-07T11:26:15.489436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.786001Z","title":"C., and Liu, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.786001Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:cea8ff1b460fa7e9de4fd0ee901709e18ee95afa245edc766b33d8808654fb63","observation_id":"aabcead0-936a-4ad9-9929-e5d6cdbdf76a","resolution":{"observed_at":"2026-08-07T11:26:14.786001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11824","last_updated":"2024-04-30T09:06:04Z","snapshot_observed_at":"2026-07-06T17:18:40.469815Z","submitted_at":"2024-01-22T10:37:59Z","title":"Rethinking Centered Kernel Alignment in Knowledge Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11824","snapshot_observed_at":"2026-08-07T11:26:14.790735Z","title":"Rethinking centered kernel alignment in knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.790735Z"},"links":{"cited_paper":"/paper/2401.11824","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:7e846293a0ec5a882472bf9533e8248972316baebed2e8bc3cf308b66c4b746c","observation_id":"ef46bbe8-0ec8-4a86-b913-da9bd885d844","resolution":{"observed_at":"2026-08-07T11:26:14.790735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:14.795852Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:14.795852Z"},"links":{"citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:68c0bbc8556f60d8a1da3875beb0a8a9aab0003878ca200dd556dc51869c71b0","observation_id":"32880931-6e19-4a41-8cc9-ebf2088f0d25","resolution":{"observed_at":"2026-08-07T11:26:14.795852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:48:10.443610Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":4,"verified_fuzzy":35},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 4 inbound Pith citation observations for arXiv:2506.02557."}