Pith. sign in

Paper Citation Record · LEDGER

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

As of 14 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 4 inbound Pith citation observations for arXiv:2506.02557.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.02557 v1

Coverage vector

measured 98 of 98 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:26:14.795852Z

measured 102 of 102 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-20T22:07:35.021986Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-20T22:09:07.132811Z

Reference resolution

98 of 98 outbound references displayed

  • verified exact4
  • verified fuzzy35
  • unresolved59
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4d16e6ee-d894-4bda-8dcc-7acfeb66ae2e · outbound

This paper cites Tallyqa: Answering complex counting questions.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Tallyqa: Answering complex counting questions

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.076810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.076810Z digest=sha256:a1069ea20341f64109ebcdd1bf01df4de3579166d190cdefe8f04ab5d7b8f672

Observation 9ac6405e-c393-4fe7-be5e-44e9302a72b6 · outbound

This paper cites Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.168645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.168645Z digest=sha256:b097767023b4b85c47cc2266be42dbf590d1cbc07aec938e53a930d17075e5fd

Observation 5b8e08a7-39c5-472a-bf0b-f4305a43ef72 · outbound

This paper cites Multi-label cluster discrimination for visual representation learning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Multi-label cluster discrimination for visual representation learning

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.268183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.268183Z digest=sha256:f5cb4e3be4b16d21096ab474461516ac006c46591589bb1a1e0b2284ede394ce

Observation dd2aea2c-c9b9-4bd1-894b-5ac1d6191e03 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.323907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.323907Z digest=sha256:a8bd422317ca54a695316450519cf5ba9b380215ebf0a6f21f297e3ba2ffe477

Observation ae69c505-1c92-4049-8542-abc0a16de6f6 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.361069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.361069Z digest=sha256:1907640d2baf97fbcba1d30aef4ad811a3732066f06228552472a8adc2eabd15

Observation 93b3c931-1656-477b-91ee-e9678554b1ea · outbound

This paper cites BE it: BERT pre-training of image transformers.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models BE it: BERT pre-training of image transformers

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.366454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.366454Z digest=sha256:b7c92f6f3dee0494bf364fed53bed2b963db726916475b03e0d5ad14479fcf43

Observation 15631b84-da0c-4158-890f-8af4e5d2f0cf · outbound

This paper cites Demystifying MMD GANs.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Demystifying MMD GANs

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.372034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.372034Z digest=sha256:828932bf2ea2aa765cda6819972b1f5f5a937bb2a2471a80551aad993c740796

Observation 687fedb5-d726-43a1-a2cd-2cb12ad73329 · outbound

This paper cites Domain prompt learning with quaternion networks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Domain prompt learning with quaternion networks

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.379895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.379895Z digest=sha256:741d9a8d6a15aaa38b370f77e988b3d9d7f39efc840536e41f9df740341d182f

Observation 18af799d-c07f-4a26-8766-b41a6ea96b33 · outbound

This paper cites Emerging properties in self-supervised vision transformers.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Emerging properties in self-supervised vision transformers

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.388470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.388470Z digest=sha256:7bcbf781d01cb1efe27eb99010e668ac5ed7e6e67f97b3fcff24c6279385bb3d

Observation 4ae0c78d-9be3-4ee3-84a6-54fc288609ed · outbound

This paper cites Microsoft COCO Captions: Data Collection and Evaluation Server.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Microsoft COCO Captions: Data Collection and Evaluation Server

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.395742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.395742Z digest=sha256:727dfba9afd2d2e300f5b0eaf2f2c4aedc2ffb78f9cd9930d8fb31656c4777db

Observation 5bc761d1-b06c-4caa-a25b-ce9284b1b416 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.404320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.404320Z digest=sha256:f3cd06711532cfd71ef5dbd91958e8d410be84c1cece0732f5a092e34d4a89d4

Observation 9aa90695-3be6-400e-943d-09083641276e · outbound

This paper cites Remote sensing image scene classification: Benchmark and state of the art.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Remote sensing image scene classification: Benchmark and state of the art

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.413877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.413877Z digest=sha256:6fc8ff99ac834bb34634182d97e1b11c91c64fe4344eaed4ac29cbdb42f050c7

Observation 2bc4a2da-efac-488c-a0ec-b5892fa02b4a · outbound

This paper cites Describing textures in the wild.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Describing textures in the wild

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.424318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.424318Z digest=sha256:b9653f28c001666bee0dc4b117140ff3d55776942d0282db0ad7feabfb6e3f45

Observation 01f684b7-2458-4e0c-844a-5c245287180d · outbound

This paper cites Locality alignment improves vision-language models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Locality alignment improves vision-language models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.433254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.433254Z digest=sha256:7aa8e418f33f454b131404ee058bff064af6a8d96422b7dc6fcbbb9e8dd45289

Observation 9ea5f798-9654-40d3-b615-2e300fe98c8e · outbound

This paper cites Vision transformers need registers.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Vision transformers need registers

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.442273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.442273Z digest=sha256:b8a4e66df67b133366fc5bba4f59b588d8bdbe91b367e26d618ab6e58431ee19

Observation 76f1de1f-3955-4271-956b-0e71f1f8478a · outbound

This paper cites FairerCLIP: Debiasing CLIP's Zero-Shot Predictions using Functions in RKHSs.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models FairerCLIP: Debiasing CLIP's Zero-Shot Predictions using Functions in RKHSs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.449072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.449072Z digest=sha256:d85192dbf9707dad0e9653e9270e64992691940880451f654a14fc1ccf8dc1dd

Observation 29001f20-7d10-4a44-aa2e-3a212bc2928b · outbound

This paper cites Imagenet: A large-scale hierarchical image database.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Imagenet: A large-scale hierarchical image database

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.458149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.458149Z digest=sha256:7a0e2d9cff22ff1d6a2effdcbe2ea7079a0691dc19ae7369928b9e19292efffb

Observation 0f19e8af-fdf4-4222-b513-e6808e566af5 · outbound

This paper cites Data Filtering Networks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Data Filtering Networks

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.466593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.466593Z digest=sha256:a92a8ca0c0db49d43b0d29a89fab04c1148212cd2ad4d3fc1ff7a8d6d4c25943

Observation e1768fd8-cc1c-4a4b-8fb5-cac422a01f1c · outbound

This paper cites Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.474213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.474213Z digest=sha256:10d5304965d5dbc4308e7096b9e9627fcdc2d193bc96b5ba3eb55a7cf0aab13c

Observation f27885c4-874f-4f66-80cd-ca21c6c67bfc · outbound

This paper cites The Vendi Score: A Diversity Evaluation Metric for Machine Learning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models The Vendi Score: A Diversity Evaluation Metric for Machine Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.482039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.482039Z digest=sha256:aefd269c5c3fcef7c722b98c90569e51a53339c383b9611ac9ddc3b33386136b

Observation fe8321d5-a764-48b8-9d49-79270960917b · outbound

This paper cites Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., et al

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.489672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.489672Z digest=sha256:37ce53543820a4ffa69eefbfef23dcaf5b0fd8239b960a99ee7d45cf70dc78a2

Observation 5e9ed5a2-454f-4ca2-afc6-0660046e0e4a · outbound

This paper cites Clip-adapter: Better vision-language models with feature adapters.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clip-adapter: Better vision-language models with feature adapters

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.498808Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.498808Z digest=sha256:c5ecf4c0678e4725e724e627441321c99808e8171c0ec3606e74c593e8052715

Observation 01bb1b83-88d7-447e-a6f6-e6d5055328d6 · outbound

This paper cites 3dsam-adapter: Holistic adaptation of sam from 2d to 3d for promptable tumor segmentation.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models 3dsam-adapter: Holistic adaptation of sam from 2d to 3d for promptable tumor segmentation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.507737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.507737Z digest=sha256:c89f64c6d8d9a10d3d6cc93d6157b43f961d2bbfeeb19f7dab2803292c055d4e

Observation 1b00e8df-c653-435c-8b8a-207190ba5e94 · outbound

This paper cites Boosting the visual interpretability of clip via adversarial fine-tuning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Boosting the visual interpretability of clip via adversarial fine-tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.514659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.514659Z digest=sha256:02877ea14d46e0e8440e7b7ae58554444d896482dbddc7a9c806c5648e99deb0

Observation d9c80418-3b83-47c1-9d71-9fe959274c87 · outbound

This paper cites J., Erhan, D., Carrier, P.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models J., Erhan, D., Carrier, P

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.523302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.523302Z digest=sha256:f4ff902a46a5bd93afc1689fdab3cc6e131627d0d784e3abbafab141bc29903c

Observation 6930017c-288a-4408-b09a-498b9b8db2e4 · outbound

This paper cites Making the v in vqa matter: Elevating the role of image understanding in visual question answering.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Making the v in vqa matter: Elevating the role of image understanding in visual question answering

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.531936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.531936Z digest=sha256:9f3d1294b275d512d89ea983f6b2697597392c04fd3ec750218a7e53be9eecef

Observation f2ecbac2-a02a-4822-91ae-6e21c4010444 · outbound

This paper cites Recovering low-rank matrices from few coefficients in any basis.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Recovering low-rank matrices from few coefficients in any basis

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.543285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.543285Z digest=sha256:73ca04bdd91d5fd046a31cc89ffa40e65546d4513b05465a216a0bb521fa4dce

Observation 366ffc2e-2196-4e70-8d5f-1cc98c69c510 · outbound

This paper cites Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.322547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.551090Z digest=sha256:444aa1ba851da0b1dd639a33507fd3540c7fb03cc91d42d920468b7c3bec37c5

Observation 3a7fc68b-0e04-4eca-a9b0-df2e2203c2b7 · outbound

This paper cites J., Guo, A., Lin, C., Grauman, K., Luo, J., and Bigham, J.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models J., Guo, A., Lin, C., Grauman, K., Luo, J., and Bigham, J

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.559218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.559218Z digest=sha256:4834a019de010f64619eb407ef9d7c3d3291c461ce8aabbde57b527e6a97e00b

Observation b69abfb6-bd6c-44df-9b2b-e0d23c980b20 · outbound

This paper cites and Ozay, M.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models and Ozay, M

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.293617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.569083Z digest=sha256:40c4a6051ca6bfe6a796b9441f54d0b7ec0d4e852099a1749ef2c0382df9ec1d

Observation 121c676e-fa5f-48ad-9c50-690fa20805bb · outbound

This paper cites Masked autoencoders are scalable vision learners.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Masked autoencoders are scalable vision learners

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.577818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.577818Z digest=sha256:8b12bbb7b364a0ba89a2e8f1818b99f0c23c23d4f95fd6308ad472e8d50fccf8

Observation 2a254a0e-9dcf-4e16-949a-9b1c1abc6c1c · outbound

This paper cites Introducing eurosat: A novel dataset and deep learning benchmark for land use and land cover classification.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Introducing eurosat: A novel dataset and deep learning benchmark for land use and land cover classification

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.263624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.585481Z digest=sha256:2685699cd8ae9bbef77ef358b5cde3bacad0f0dcefce8efcf0abc7d2e5d026f1

Observation 4d7b9426-0970-4aae-b9d7-3d9b4b0597f1 · outbound

This paper cites Natural adversarial examples.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Natural adversarial examples

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.245014Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.594682Z digest=sha256:79326b91a180065f77cc8a5762052ba2d1c01c2e21db05e789100282f7cf63e2

Observation cf580be8-ad12-443a-9c32-81712a0531de · outbound

This paper cites Probability inequalities for sums of bounded random variables.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Probability inequalities for sums of bounded random variables

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.227681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.603893Z digest=sha256:77cbb689a5c02466fc868410063a8115cedeb258497b5af8f5701a1e0fe612a4

Observation 4416e393-5b99-45c6-9ea9-dba6335057b2 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:26:16.203710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.611022Z digest=sha256:1b7fe2c9515b498d7b7084fe9aa9e561f1de019c16e5b532fecd4428e4984639

Observation dc363e2b-3006-4734-a536-73a19962b57a · outbound

This paper cites J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models J., yelong shen, Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.622913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.622913Z digest=sha256:3e75dd5b8a759ff50deba607466ddbf7bdb433963201b4222f2263f2e287c9bb

Observation ec4452a5-ec39-44de-b667-91adde54424a · outbound

This paper cites T., and Farnia, F.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models T., and Farnia, F

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.171988Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.629823Z digest=sha256:e7946bf93eaab595ef8e2c4db6e7e8528ed82732be12ba3fcb62bb7b1dca1f58

Observation eae863a3-ed91-4854-9112-b5ceaa723332 · outbound

This paper cites T., and Farnia, F.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models T., and Farnia, F

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.156234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.639656Z digest=sha256:3b4262059f2554b38e48f5e995c109060b11952445f33a43694ec28cd9314702

Observation dbba5313-2aad-4768-8d8a-e44aa9ffa657 · outbound

This paper cites From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.676257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.676257Z digest=sha256:b7344eb4dc40fda64b65cdcefb2a33c620377d36adb0a19b7e5e89277e6f5673

Observation 206e2dba-54a7-45c6-8e8b-d3e48972387e · outbound

This paper cites Clevr: A diagnostic dataset for compositional language and elementary visual reasoning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clevr: A diagnostic dataset for compositional language and elementary visual reasoning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.137088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.710170Z digest=sha256:f9a9eb56a05de41788f6e8a26ec760c4fdbe811a55c800c08a880d530633f74d

Observation ad4df0c3-f888-4b8c-81b7-7cf62eae08cc · outbound

This paper cites What's ''up'' with vision-language models? investigating their struggle with spatial reasoning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models What's ''up'' with vision-language models? investigating their struggle with spatial reasoning

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.118412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.745597Z digest=sha256:d92320624277eb7fe52b99e02f58f1acc04ccf3063d9711039e2013871247087

Observation bc348745-03d8-4a07-95c6-203ae6f6619c · outbound

This paper cites Studiogan: A taxonomy and benchmark of gans for image synthesis.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Studiogan: A taxonomy and benchmark of gans for image synthesis

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.769979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.769979Z digest=sha256:2596f32cba34c9047f94ac7ea8c0abded8d7042de25af6138820286804e05fb0

Observation e2a1764d-f340-4029-ab33-673f15dd52c5 · outbound

This paper cites Referitgame: Referring to objects in photographs of natural scenes.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Referitgame: Referring to objects in photographs of natural scenes

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.098644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.788031Z digest=sha256:3e1e8784af4bc7af3a9c3eb11b05ed9f7fd55ebb59b560a365b0b4ef7cd0e194

Observation fd87e030-16f8-4a32-8da4-d7c713a2ebcb · outbound

This paper cites A diagram is worth a dozen images.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models A diagram is worth a dozen images

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.076987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.814240Z digest=sha256:0884dcfb553c1725235c2edf5f9bd6730e898232259914d84e9e437b8a8c6f08

Observation 1d4571e4-a51e-4c97-a34b-51d71ddfc5ed · outbound

This paper cites The hateful memes challenge: Detecting hate speech in multimodal memes.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models The hateful memes challenge: Detecting hate speech in multimodal memes

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.058144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.852337Z digest=sha256:aaeef9fb40c8da33c7d6624a659c963ffbc522b1cecad31ddbfb45a45cf397ee

Observation 4f904f8d-1662-4281-94b0-c76d3ac765c4 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.878916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.878916Z digest=sha256:7fb784434355831a2d7ed767fb2faedb9e49b889fbb5cde07c81920f05aebab5

Observation da99cb35-99f2-40e9-b0d1-58ece4309242 · outbound

This paper cites Learning multiple layers of features from tiny images.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Learning multiple layers of features from tiny images

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.897490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.897490Z digest=sha256:646a8113af1c9b1265036e0a12646c0a4a361d77da4dcfc8b6255f0b85f44533

Observation fdc3bc36-8274-4109-a257-e0b499b0d560 · outbound

This paper cites Clip benchmark: Clip-like model evaluation, 2022.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clip benchmark: Clip-like model evaluation, 2022

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:16.019546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.931847Z digest=sha256:a1da4540cd3d681e4abcbded21c6eae671680ee32a9ec52dfd5341167609c397

Observation 986ea017-a1a9-423e-a162-80aa191b2015 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:13.958430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:13.958430Z digest=sha256:63c73479ce57e652b127677580575ec6762075440dd3991b99588c6ab0a4626d

Observation ab00bb5c-ea22-4fe4-b469-420a53fd3470 · outbound

This paper cites Transfer learning in computer vision tasks: Remember where you come from.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Transfer learning in computer vision tasks: Remember where you come from

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.987195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:13.985748Z digest=sha256:cf0f833b27029502252e1767555cb26038835a3fc29c95d5aa1130447023bcab

Observation 0e1a228a-284d-4834-acf0-c75ca3829e9a · outbound

This paper cites Evaluating object hallucination in large vision-language models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Evaluating object hallucination in large vision-language models

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.971091Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.022976Z digest=sha256:ee8fb28194ed6aeaa63d7ca893151423d28bd102a3f7dca6415d9270c611406c

Observation b55b8aa9-9a3c-492d-85ad-173108fd5013 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.058425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.058425Z digest=sha256:398825f72ba0efab0280c2c36b3eff23335b4587935d85181af3f9036dad7535

Observation 941bbed5-eb97-4269-8ad7-47c1f58e61e1 · outbound

This paper cites Visual spatial reasoning.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Visual spatial reasoning

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.943536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.093939Z digest=sha256:3dc36de17d26a61a0713a89d1405324ff48d68dd87d6f6eed91c26d08739c61e

Observation 95581358-a2dc-4a8f-8e01-5f39a1289963 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.130078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.130078Z digest=sha256:11ac9c6810e511d257c157eabe77079f4512e3dbc8d3469360a44ce7c608e1fe

Observation ad658fa4-a1d9-4e11-88d2-2c6fa4d826b1 · outbound

This paper cites Decoupled Weight Decay Regularization.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Decoupled Weight Decay Regularization

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.157884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.157884Z digest=sha256:8edc35f227e617d4809fff0190f7557b0d4b590338f129ac4d12c7814ede31ec

Observation 2b9b5496-ad13-4cc1-b52b-2c82d1c81616 · outbound

This paper cites Understanding Zero-Shot Adversarial Robustness for Large-Scale Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Understanding Zero-Shot Adversarial Robustness for Large-Scale Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.191544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.191544Z digest=sha256:c93a3d48f8d4f2a03cc9f24d96677f22b10909be326c3495a7690bf412d73fc2

Observation 97d40f26-43b0-4ba1-b6c8-bbf546f4a1d4 · outbound

This paper cites Ok-vqa: A visual question answering benchmark requiring external knowledge.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Ok-vqa: A visual question answering benchmark requiring external knowledge

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.214004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.214004Z digest=sha256:b9a0659f279d8f460acb370d38cdf8114b87adddcd48c3340250a9335b9b99c7

Observation 53d26859-b591-4ff0-8722-4807ae2a4770 · outbound

This paper cites Y., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Y., et al

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.234636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.234636Z digest=sha256:5a22d918c63e8d27f9006d7784d481939243441508ab78704514269437165371

Observation 76527488-a35d-443a-aab9-e2a81759f282 · outbound

This paper cites Dinov2: Learning robust visual features without supervision.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Dinov2: Learning robust visual features without supervision

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.894122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.250170Z digest=sha256:6d1c289cdbf1ff779593c02b44123c40cd492544ba5f8bde348c046660689cf6

Observation dcf1e64b-a01b-4377-bd5c-3489b89a64c3 · outbound

This paper cites Do Vendi Scores Converge with Finite Samples? Truncated Vendi Score for Finite-Sample Convergence Guarantees.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Do Vendi Scores Converge with Finite Samples? Truncated Vendi Score for Finite-Sample Convergence Guarantees

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.272780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.272780Z digest=sha256:4d91ee98a2b69553a3538c179a7213c1c9f19eaaed6d60d7c0d0c1f421a1aad3

Observation 1a5fae69-ee38-41bc-b5dc-14c10c800486 · outbound

This paper cites Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings

Reference 61

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:15.081496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.289306Z digest=sha256:6689c41f1eea440a87dd1999fe5ec4493cc51a343bb277758d6fd236427dab7e

Observation 74d19f35-21aa-471d-910a-247e7ee840c8 · outbound

This paper cites Towards a scalable reference-free evaluation of generative models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Towards a scalable reference-free evaluation of generative models

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.875218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.310303Z digest=sha256:7fde2435c0280311a97acb3a815e2380c0764aabf83a10920abaeb2e2f380f0f

Observation 43bac356-ca4d-42a1-81aa-2d9b908b5fc7 · outbound

This paper cites M., Vedaldi, A., Zisserman, A., and Jawahar, C.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models M., Vedaldi, A., Zisserman, A., and Jawahar, C

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.857821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.315818Z digest=sha256:68806f3cdb5ecce21909c5f4150759d6ee801420e054a159ad0f898ca9c144b9

Observation 2618be62-08dc-4987-b436-f6c8b8b33a5d · outbound

This paper cites W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.327491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.327491Z digest=sha256:711b68110fc466e127973c1b1d9e918d932bbb78302de945bf96d4c3759f31f0

Observation 36b7853d-b122-4b04-98f4-4a8a043db632 · outbound

This paper cites Am-radio: Agglomerative vision foundation model reduce all domains into one.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Am-radio: Agglomerative vision foundation model reduce all domains into one

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.828165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.337840Z digest=sha256:ed549674977ef913152af0920c98928089c33c50f9587f62b74a9d8765d0818b

Observation 918a3279-df71-4ef6-937d-790a1d9df14b · outbound

This paper cites Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Be More Diverse than the Most Diverse: Optimal Mixtures of Generative Models via Mixture-UCB Bandit Algorithms

Reference 66

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:15.058806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.349429Z digest=sha256:35e5e078ee085c25b5578d51d2983bde154b7134266809ae4ac1c858977798d3

Observation 6ac9159c-f5d3-405d-81b3-fcf795583ee8 · outbound

This paper cites Improved zero-shot classification by adapting vlms with text descriptions.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Improved zero-shot classification by adapting vlms with text descriptions

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.809295Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.362400Z digest=sha256:3047d6965578594b0404f6d8dfbeb63e2333e401472747cb4b4f820fed31af32

Observation 4e5c131a-6d20-4eff-b873-ca932678061f · outbound

This paper cites CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement

Reference 68

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:15.035097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.375483Z digest=sha256:62b4004b744fdf2ec9a5d59e2600a093253054ec403c04a2f957c9734d7ac06c

Observation ebf584df-d99f-4edd-a28a-dc9ee716d36c · outbound

This paper cites Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.409174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.409174Z digest=sha256:d401ada3871417a2a02085188bd5fcc2a7d6e16e0d2d0f343d008b92163879b4

Observation b6b6a7b7-2294-4b70-ba5a-04f1a26dbd1c · outbound

This paper cites MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.425638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.425638Z digest=sha256:7ea1da5d12a33cec28e6f778ed5c05d5ac30771958b17b34dd90156fb7ca7e5a

Observation 73f02e0a-268b-47b9-8f9d-0ec95bc9ce56 · outbound

This paper cites Finetuning Text-to-Image Diffusion Models for Fairness.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Finetuning Text-to-Image Diffusion Models for Fairness

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.450325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.450325Z digest=sha256:2be09268dd54a5b2e4e7dfc81d36f60054f087be096938ba366f25a63037db1b

Observation 5efff50b-5682-40c5-b5d9-0ed382beb549 · outbound

This paper cites Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.486555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.486555Z digest=sha256:7fca2f215565d92ad868e96e30315901d2146b848f3b4b77511ea38db2cc0718

Observation 86c03fab-1dc6-414c-9dd9-3cf325655264 · outbound

This paper cites Towards vqa models that can read.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Towards vqa models that can read

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.514075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.514075Z digest=sha256:52b58902f513bd147e758c2c1dd8c4cf71cc2fd686ebe5ab9d676d315ee7702e

Observation d5eeb4e4-5a06-4026-845f-44b8f6fe2d19 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 74

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:26:15.779942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.532330Z digest=sha256:188b3c79796d49355daa623ea6f81e98594399b63fe12c6923769dd9b4e43e98

Observation a43fc90d-4703-49a7-8e49-220310d8585c · outbound

This paper cites L., Taylor, E., and Loaiza-Ganem, G.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models L., Taylor, E., and Loaiza-Ganem, G

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.758280Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.567592Z digest=sha256:cebdbb122a9b8fde317e0aadec0cbb738e9ec2919fcba63c2474215a8b26a900

Observation 92360aea-3301-4b3a-8ae3-14ba88afdfd5 · outbound

This paper cites EVA-CLIP: Improved Training Techniques for CLIP at Scale.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models EVA-CLIP: Improved Training Techniques for CLIP at Scale

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.595926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.595926Z digest=sha256:2b7ad8cdfe4559471812baf4f35cf8c86a71d02cdd3da19a80e2e33998a649fc

Observation 75fce3a4-6058-4509-a68a-2ce192512d2d · outbound

This paper cites Winoground: Probing vision and language models for visio-linguistic compositionality.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Winoground: Probing vision and language models for visio-linguistic compositionality

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.740074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.633074Z digest=sha256:93ae9680b70f5c82d95529806b1c32f4424ce83a420f627f31923ad89db6aae3

Observation 8a11379d-27de-4437-81c4-d11d76d335b6 · outbound

This paper cites Eyes wide shut? exploring the visual shortcomings of multimodal llms.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Eyes wide shut? exploring the visual shortcomings of multimodal llms

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.668972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.668972Z digest=sha256:8f4e65c2749acfba8d3ee02b08370bd2fdf4f92cfe2f4dbdc3ed591462710963

Observation 8958d4da-88b8-4d83-a640-75d27891eb51 · outbound

This paper cites S., Linmans, J., Winkens, J., Cohen, T., and Welling, M.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models S., Linmans, J., Winkens, J., Cohen, T., and Welling, M

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.709139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.688699Z digest=sha256:ac5ac699c4788d90e74d7f947cf6406f8273b5f430533047c8d0cc84f7c59218

Observation bd473008-39b0-4582-86b0-9cf57d3e5756 · outbound

This paper cites Clip the gap: A single domain generalization approach for object detection.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Clip the gap: A single domain generalization approach for object detection

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.691181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.693990Z digest=sha256:e48a9725134bb4bf347bc2b189a6682206e95aaeda7ee367fb4c3ee5b1a2c3c5

Observation e5740819-6d52-4e95-8a60-38da9a6d39f4 · outbound

This paper cites S., Steiner, A.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models S., Steiner, A

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.673241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.699343Z digest=sha256:58935fc454fff7f5aa07ed14efeb77c83f14f94b2ec4f777df39631c04c0233a

Observation b7a586b6-5dc2-43c8-bc52-d27d87f85af7 · outbound

This paper cites an unresolved cited work.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unresolved cited work

Reference 82

Resolution
unresolved
raw_fallback, observed 2026-08-07T11:26:15.655991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.708069Z digest=sha256:7d7258b5d38734a575fa0f16f5268885ed9231f30422e2420c6df71d53dbc77f

Observation 65186142-1aa3-4919-9f62-ca235b46f4c6 · outbound

This paper cites Diffusion feedback helps clip see better.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Diffusion feedback helps clip see better

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.640372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.714678Z digest=sha256:d35dd6f5fdc4390af026fcfe053e0ee2aea7891796039828ec3243a385c34686

Observation 62d63c46-d754-4f26-828f-ce1d23533941 · outbound

This paper cites CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.720443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.720443Z digest=sha256:c951f4e4380308ff7702b9a49c7208951a7ee6ec852bf0a7579d7a15d5169927

Observation a43c192a-2ac7-447c-a69d-9cc493a6cfcf · outbound

This paper cites Demystifying CLIP data.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Demystifying CLIP data

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.623105Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.725923Z digest=sha256:52408ebcf540a6e33db491d70b634e0d23757b3aa61b6eef425c515bea0c1de8

Observation c367537a-4415-49b2-9169-6420db8b0cea · outbound

This paper cites Explicit inductive bias for transfer learning with convolutional networks.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Explicit inductive bias for transfer learning with convolutional networks

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.606495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.731229Z digest=sha256:6014bfd02b29ce8c7672171e3edf3140e32601ab51dd0352eef8b30bddb91a7a

Observation 984b5b48-16a6-4047-ac45-5dbea0e582a2 · outbound

This paper cites From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.587517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.736867Z digest=sha256:852e912c93c8f415fb7d81da6b1896d8e93a620e6a3131b468d2c10e9bcec53d

Observation a6135983-a5c7-4bad-a1fd-8200c9309782 · outbound

This paper cites C., and Berg, T.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models C., and Berg, T

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.570210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.741696Z digest=sha256:de9d72f14256a1662c528f9f762d3f642934b412ec57ee2626caeb0458f7ec81

Observation 74155806-e21b-4baf-881f-117b867164ee · outbound

This paper cites Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.554372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.746368Z digest=sha256:2628ff848953dd6baf65d3c622134ff105659fbe60551909cde8fb7c9f74bbdb

Observation 215a7a43-1c7f-4c53-bc74-17924b037985 · outbound

This paper cites When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations, 2023.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations, 2023

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.538506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.752572Z digest=sha256:c0e37db03b7321b980c5d1a59acff7f2700a3edc1545401e240e2acef3c640e0

Observation 2cb6e895-9f87-4c8d-8c4d-69b22d6ba8ec · outbound

This paper cites Sigmoid loss for language image pre-training.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Sigmoid loss for language image pre-training

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.757778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.757778Z digest=sha256:f9dd83cb57b7c13310abf9a4eadbbdeeb2fd592e5240d5cc463e1de6289949cf

Observation 4bfa7c29-6693-46f8-b2ca-bd214c111d9c · outbound

This paper cites Unveiling Differences in Generative Models: A Scalable Differential Clustering Approach.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Unveiling Differences in Generative Models: A Scalable Differential Clustering Approach

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.763166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.763166Z digest=sha256:8ab5145fbabff247c45b16dc0407a4e176b0f3a67b18bcda5ff45c648e6226f9

Observation f147c74c-a66a-443c-a7e1-333c75204a53 · outbound

This paper cites An Interpretable Evaluation of Entropy-based Novelty of Generative Models.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models An Interpretable Evaluation of Entropy-based Novelty of Generative Models

Reference 93

Resolution
verified exact
local_arxiv, observed 2026-08-07T11:26:14.871675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.769062Z digest=sha256:d5c1e0b5c30e1005476bfdac11fdf831f89edb5e8c2a955b7d579f2242c94f51

Observation dc3159f4-8721-495b-b9dd-4cb65b7c68ef · outbound

This paper cites Tip-adapter: Training-free adaption of clip for few-shot classification.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Tip-adapter: Training-free adaption of clip for few-shot classification

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.510047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.774232Z digest=sha256:7b65208266942c54d76232f25a3bfe338beae2e50b930deba7dba2023fb29035

Observation bd3c76e1-ac43-4256-a6c3-cb6b3b7ec446 · outbound

This paper cites H., Zhou, L., Dai, X., Yuan, L., Li, Y., et al.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models H., Zhou, L., Dai, X., Yuan, L., Li, Y., et al

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:26:15.489436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-07T11:26:14.780451Z digest=sha256:8e26da88aa5d834f33616f05ce170e93232d15c70fd104d8157cfa24f1b253e9

Observation aabcead0-936a-4ad9-9929-e5d6cdbdf76a · outbound

This paper cites C., and Liu, Z.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models C., and Liu, Z

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.786001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.786001Z digest=sha256:dd32d6edb84615b39b6e7b20c3a4e20ff63e1ef606f1e692f8f37660616bba0e

Observation ef46bbe8-0ec8-4a86-b913-da9bd885d844 · outbound

This paper cites Rethinking Centered Kernel Alignment in Knowledge Distillation.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models Rethinking Centered Kernel Alignment in Knowledge Distillation

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.790735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.790735Z digest=sha256:a3f97813e0c32141ba6f6ac70eb7a1f0d6e12fc4475505c26c3208d69eb12af2

Observation 32880931-6e19-4a41-8cc9-ebf2088f0d25 · outbound

This paper cites write newline.

Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models write newline

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-07T11:26:14.795852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:26:14.795852Z digest=sha256:5821dc398cd5129bad869ddbc5f232b12f20485b038be761254118403a7eeb36

Pith citing papers

Observation d62736ac-a819-41bb-a7c7-eb0abf546778 · inbound

UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels cites this paper.

UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-10T08:32:52.003486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T08:32:36.729122Z digest=sha256:a203a05e72a325d8772396f3c5a928db9d502010e82f4d1a38e6c6dc6b80977d

Observation a3fff1ec-2d20-4ddc-ad54-cc96cf462af6 · inbound

Latent Denoising Improves Visual Alignment in Large Multimodal Models cites this paper.

Latent Denoising Improves Visual Alignment in Large Multimodal Models Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-09T23:09:26.700458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-09T23:07:54.806529Z digest=sha256:ff09dc0dc0a6330214e749ffab115c72ec1f1b9873ca74cba34354c17c65ff7d

Observation 5b84b43d-5e64-4629-a595-4b924cbc06b4 · inbound

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning cites this paper.

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-14T19:17:51.075371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-14T19:14:03.809826Z digest=sha256:2cf7f067ea1dfa254c7a66e40ba7868e299da4fb3f2ce772d5918435a35623e5

Observation 885178fa-8e7d-4394-a495-a60a3a927002 · inbound

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning cites this paper.

A$_3$B$_2$: Adaptive Asymmetric Adapter for Alleviating Branch Bias in Vision-Language Image Classification with Few-Shot Learning Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-20T22:09:07.135657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-20T22:07:35.021986Z digest=sha256:b73764f25cf87ae2a23b17a36a46d35febcd619c2bd9c436d6eb7b4c176680f3