Hugging Face Daily PapersMingfei Gao, Rui Tian, Haiming Gang1 min readpaperadvanced
MintAct: A Unified Visual Agent for Digital Environments
Summary
MintAct is a family of vision-language models (2B-8B) that unifies UI grounding, multi-step navigation, and visual tool use across mobile, desktop, and web environments. It achieves state-of-the-art performance by leveraging a scalable environment and an asynchronous reinforcement learning infrastructure.
- MintAct unifies UI grounding, multi-step navigation, and visual tool use across diverse digital environments.
- The models are scaled at 2B, 4B, and 8B parameters, matching specialist performance.
- A scalable environment hosts hundreds of concurrent instances for data collection and online RL.
- An asynchronous RL framework manages cross-domain training distribution and maintains stability.
This paper is significant for researchers and engineers building general-purpose AI agents, as it demonstrates a unified and scalable approach to visual interaction across diverse digital environments.
8/10
