Research
I'm broadly interested in computer vision, Multimodal learning, deep learning, and interpretability. My recent work has been focusing on the emergent capabilities and the multimodal representation of Multimodal Large Language Models.
|
|
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
Brandon Huang,
Hang Hua,
Zhuoran Yu,
Trevor Darrell,
Rogerio Feris,
Roei Herzig,
ICLR, 2026
Paper
|
|
Sparse Attention Vectors: Generative Multimodal Model Features Are
Discriminative Vision-Language Classifiers
Chancharik Mitra*,
Brandon Huang*,
Tianning Chai,
Zhiqiu Lin,
Assaf Arbelle,
Rogerio Feris,
Leonid Karlinsky,
Trevor Darrell,
Deva Ramanan,
Roei Herzig,
ICCV, 2025
Paper
|
|
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
Brandon Huang*,
Chancharik Mitra*,
Assaf Arbelle,
Leonid Karlinsky,
Trevor Darrell,
Roei Herzig,
NeurIPS, 2024
Paper
|
|
Compositional Chain-of-Thought Prompting for Large Multimodal Models
Chancharik Mitra,
Brandon Huang,
Trevor Darrell,
Roei Herzig,
CVPR, 2024
paper
|
|