1
Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning
The paper pinpoints two weaknesses in latent‑reasoning pipelines—suboptimal visual token encoders and deterministic RL sampling—and proposes Scaffolding Minds, which trains a dedicated scaffolding encoder and a stochastic RL sampler (learning both mean and variance). This yields up to +19 points improvement on spatial planning tasks and +5.6 points average gain on nine visual reasoning benchmarks.
Hugging Face Daily Papersarxiv.org1 minpaper
