Hugging Face Daily PapersRui Zhong, Yu Li, Zheyu Yan1 min readpaperadvanced
Beyond Selection: Token Parameterization for Extreme Visual Token Compression
Summary
This paper introduces Braco, a lightweight coder for extreme visual token compression in vision-language models. It uses a novel token parameterization approach to maintain visual grounding and achieve high accuracy at 23x-64x compression, significantly improving efficiency over prior methods.
- Extreme visual token compression is challenging; pruning breaks visual grounding, while learned resamplers add complexity and cost.
- Braco proposes token parameterization, separating basis transformation/truncation from coordinate organization for compression.
- The four-step coder combines transform-basis truncation, input-independent basis-coordinate embeddings, and budget-dependent orthogonal re-parameterization.
- Braco achieves 95.2% accuracy at 23x-64x compression, remaining competitive at 144x, forming a favorable accuracy-efficiency frontier.
Engineers working with vision-language models will find this relevant for significantly improving model efficiency and reducing computational costs under extreme compression budgets.
8/10