Bioclip 2: Emergent properties from scaling hierarchical contrastive learning

Jianyang Gu, Samuel Stevens, Elizabeth G · 2025 · arXiv 2505.23883

7 Pith papers cite this work. Polarity classification is still indexing.

7 Pith papers citing it

read on arXiv browse 7 citing papers

citation-role summary

background 1

citation-polarity summary

background 1

representative citing papers

Audio-to-Image Bird Species Retrieval without Audio-Image Pairs via Text Distillation

cs.SD · 2026-01-31 · conditional · novelty 7.0

Text distillation from BioCLIP-2 into BioLingual creates audio-image alignment for bird species retrieval without any audio-image training pairs.

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

cs.CV · 2025-06-10 · unverdicted · novelty 7.0

AVA-Bench evaluates vision foundation models by disentangling 14 atomic visual abilities with aligned training-test distributions to reveal precise ability fingerprints.

Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring

cs.CV · 2026-06-19 · unverdicted · novelty 6.0

Cross-modal agreement between zero-shot visual detection and acoustic classification recovers known Milu deer activity patterns consistent with published behavioral priors, enabling annotation-light validation.

PRIMA: Boosting Animal Mesh Recovery with Biological Priors and Test-Time Adaptation

cs.CV · 2026-06-01 · unverdicted · novelty 6.0

PRIMA boosts 3D quadruped mesh recovery by injecting BioCLIP biological priors and using test-time adaptation with 2D constraints to build the Quadruped3D pseudo-3D dataset and reach SOTA on imbalanced animal benchmarks.

Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval

cs.IR · 2026-01-30 · unverdicted · novelty 6.0

Compact binary hypercube embeddings enable efficient text-to-image and text-to-audio retrieval in wildlife databases with performance competitive to continuous embeddings but far lower memory and search costs.

CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis

cs.CV · 2026-05-05 · unverdicted · novelty 5.0

CropVLM is a domain-adapted vision-language model that achieves 72.51% zero-shot crop classification accuracy and superior open-set detection performance on novel species without retraining.

Multi-Object Tracking Consistently Improves Wildlife Inference

cs.CV · 2026-05-15 · unverdicted · novelty 4.0

Applying multi-object tracking to fuse softmax probabilities across frames in camera trap data yields weighted F1-score gains of 5.1%, 3.1%, and 2.0% over standalone classifiers on three datasets.

citing papers explorer

Showing 6 of 6 citing papers after filters.

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models cs.CV · 2025-06-10 · unverdicted · none · ref 29
AVA-Bench evaluates vision foundation models by disentangling 14 atomic visual abilities with aligned training-test distributions to reveal precise ability fingerprints.
Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring cs.CV · 2026-06-19 · unverdicted · none · ref 11
Cross-modal agreement between zero-shot visual detection and acoustic classification recovers known Milu deer activity patterns consistent with published behavioral priors, enabling annotation-light validation.
PRIMA: Boosting Animal Mesh Recovery with Biological Priors and Test-Time Adaptation cs.CV · 2026-06-01 · unverdicted · none · ref 13
PRIMA boosts 3D quadruped mesh recovery by injecting BioCLIP biological priors and using test-time adaptation with 2D constraints to build the Quadruped3D pseudo-3D dataset and reach SOTA on imbalanced animal benchmarks.
Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval cs.IR · 2026-01-30 · unverdicted · none · ref 16
Compact binary hypercube embeddings enable efficient text-to-image and text-to-audio retrieval in wildlife databases with performance competitive to continuous embeddings but far lower memory and search costs.
CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis cs.CV · 2026-05-05 · unverdicted · none · ref 32
CropVLM is a domain-adapted vision-language model that achieves 72.51% zero-shot crop classification accuracy and superior open-set detection performance on novel species without retraining.
Multi-Object Tracking Consistently Improves Wildlife Inference cs.CV · 2026-05-15 · unverdicted · none · ref 13
Applying multi-object tracking to fuse softmax probabilities across frames in camera trap data yields weighted F1-score gains of 5.1%, 3.1%, and 2.0% over standalone classifiers on three datasets.

Bioclip 2: Emergent properties from scaling hierarchical contrastive learning

citation-role summary

citation-polarity summary

fields

years

verdicts

roles

polarities

representative citing papers

citing papers explorer