1
Region-Level Policy Optimization for Fine-grained MLLM Perception
Vision‑RL2 trains a lightweight proposal network via region‑level reinforcement learning to select high‑resolution evidence for multimodal LLMs, allowing coarse‑resolution localization and fine‑resolution recognition. Across six fine‑grained vision benchmarks it reduces visual token count by ~4× while matching or surpassing full‑resolution accuracy.
Hugging Face Daily Papersarxiv.org1 minpaper
