Hugging Face Daily PapersNagham Omar, Mahmoud Jabarin, Maya Rozenshtein1 min readpaperadvanced
Generalization Is Stability, Not Accuracy: Multi-Axis Evaluation of LLMs
Summary
This paper redefines LLM generalization as output stability across varied inputs, rather than just accuracy. It introduces SAGO, a multi-axis framework, finding that many LLMs exhibit significant and consistent generalization instability across different behavioral dimensions.
- Generalization in LLMs should be defined as output stability across varied inputs, not just aggregate accuracy.
- Existing evaluation methods conflate robustness with overall benchmark performance, obscuring true generalization.
- The SAGO framework measures variability across generation consistency, internal activations, confidence, and response mirroring.
- Many commonly used LLMs exhibit statistically significant and consistent generalization instability.
Engineers and researchers evaluating or deploying LLMs should care, as it provides a more robust and nuanced method for assessing model generalization beyond simple accuracy metrics.
8/10
