Visualoverload: Probing visual understanding of vlms in really dense scenes
Author(s):
Paul Gavrikov, Wei Lin, M. Jehanzeb Mirza, Soumya Jahagirdar, Muhammad Huzaifa, Sivan Doveh, Serena Yeung-Levy, James Glass, Hilde Kuehne
Published in:
CVPR, 2026
Publisher:
cvf
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
Author(s):
Edson Araujo, Andrew Rouditchenko, Yuan Gong, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Leonid Karlinsky, Rogerio Feris, James R. Glass, Hilde Kuehne
Published in:
CVPR, 2025
Publisher:
CVF
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
Author(s):
Walid Bousselham, Angie Boggust, Sofian Chaybouti, Hendrik Strobelt, Hilde Kuehne
Published in:
ICCV, 2025
Publisher:
cvf
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
Author(s):
Walid Bousselham, Angie Boggust, Hendrik Strobelt, Hilde Kuehne
Published in:
ECCV, 2026
Publisher:
Springer
VideoGEM: Training-free Action Grounding in Videos
Author(s):
Felix Vogel, Walid Bousselham, Anna Kukleva, Nina Shvetsova, Hilde Kuehne
Published in:
CVPR, 2025
Publisher:
cvf
MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data
Author(s):
Siarhei Sheludzko, Dhimitrios Duka, Bernt Schiele, Hilde Kuehne, Anna Kukleva
Published in:
WACV, 2026
Publisher:
cvf
MaskInversion: Localized Embeddings via Optimization of Explainability Maps
Author(s):
Walid Bousselham, Sofian Chaybouti, Christian Rupprecht, Vittorio Ferrari, Hilde Kuehne
Published in:
ICLR, 2026
Publisher:
ICLR