Hugging Face Daily PapersMir Tafseer Nayeem, Davood Rafiei2 min readpaperadvanced
How Does "English (US)" Become the Default? Triangulating Structural Bias Towards American English Across the LLM Pipeline
Summary
This paper investigates how American English (AmE) becomes the default in LLMs, despite global English diversity. It found AmE is consistently favored across pretraining/post-training data, tokenization, and generation, leading to structural bias.
- AmE is consistently favored over BrE across 6 pretraining and 21 post-training datasets.
- Tokenizers generally represent AmE more compactly, leading to lower prediction costs.
- LLMs default to AmE generation even with neutral prompts; BrE prompts don't fully eliminate this bias.
- The study introduces DiAlign, a training-free method for estimating regional linguistic alignment.
AI developers and researchers should care as this study rigorously demonstrates a pervasive structural bias in LLMs towards American English, impacting global fairness and linguistic diversity.
8/10

