A Comprehensive Survey on Bias and Fairness in Large Language Models
摘要
Large Language Models (LLMs) excel in various applications, from conversational agents to medical diagnostics. However, they often inherit societal biases from training data, risking discriminatory outcomes. This survey provides a structured review of fairness in LLMs, analyzing the origins of bias in data and model design. We summarize key bias evaluation metrics, including embedding-based and probability-based approaches, and examine mitigation techniques in pre-processing, in-processing, and post-processing strategies. We also highlight essential datasets and tools for fairness research and discuss current challenges, offering future directions to guide the development of fairer LLMs.