Hugging Face Daily PapersJunjie Chen, Fei Wang, Kun Li1 min readpaperadvanced
EvolvingAvatar: Interactive 3D Head Generation That Adapts as Conversations Unfold
Summary
EvolvingAvatar is a novel 3D head generation model that adapts to ongoing conversations using test-time training and a self-supervised dyadic context prediction objective. It improves conversational motion statistics by learning from user audiovisual input during interaction, reducing expression mismatch by up to 11.1%.
- EvolvingAvatar uses test-time training to adapt 3D head generation to live conversational dynamics.
- A dyadic context prediction objective enables self-supervised learning from audiovisual context without explicit motion labels.
- It employs persistent fast weights for long-term adaptation and transient jaw adaptation for immediate responses.
- The model's adaptation improves generation, especially on out-of-distribution data, reducing expression mismatch.
This work is significant for researchers and developers building highly realistic and interactive virtual avatars, as it addresses the critical challenge of dynamic, context-aware conversational motion.
8/10
