提高语言嵌入模型中复杂术语组的偏差评估:方法的定量比较
Magnus Gray1, Mariofanna Milanova2, Leihong Wu1
1Division of Bioinformatics & Biostatistics, National Center for Toxicological Research, US Food and Drug Administration, Jefferson, AR, United States.
一种新的方法,标准偏差词嵌入关联测试 (SD-WEAT),提供了一种更强大和可靠的方法来测量人工智能 (AI) 语言模型中的偏差. 这种改进的技术解决了以前方法的局限性,确保了更公平的AI开发.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 人工智能 (AI) 伦理学 伦理学
- 机器学习模型评估
背景情况:
- 人工智能 (AI) 系统越来越多地在各个行业中使用,但它们可以延续和放大社会偏见.
- 测量人工智能偏差的现有方法,例如词嵌入关联测试 (WEAT),具有局限性,包括非稳定性和依赖预定义的词组.
- 需要改进的方法来准确测量和减轻人工智能的偏见,以确保公平和道德的发展.
研究的目的:
- 引入一种更改和更强大的测量方法,用于检测AI语言模型中的偏差.
- 解决传统的词嵌入关联测试 (WEAT) 的局限性.
- 提高自然语言处理嵌入式中偏差测量的适用性和可靠性.
主要方法:
- 引入标准偏差词嵌入关联测试 (SD-WEAT),这是WEAT的新型修改.
- SD-WEAT通过分析多个WEAT排列的标准偏差来计算偏差.
- 在著名的语言嵌入模型中评估偏差和稳定性:GloVe,Word2Vec和BERT.
主要成果:
- SD-WEAT表现出与WEAT可比的结果,偏差分数 (r=0.786) 和P值 (r=0.776) 的高相关性.
- SD-WEAT克服了WEAT的局限性,消除了对预定义属性组的需求,并通过多次运行减少了异常值的影响.
- 这种新方法被证明比原来的WEAT更为一致和可靠,用于偏差评估.
结论:
- SD-WEAT为AI语言模型嵌入中强大的偏差测量提供了一个有希望的进步.
- 这种方法为评估和减轻人工智能偏差提供了更大的可访问性和可靠性.
- SD-WEAT有助于开发更公平,更公平的AI技术.
更多相关视频
06:48Lexical Decision Task for Studying Written Word Recognition in Adults with and without Dementia or Mild Cognitive Impairment
Published on: June 25, 2019
08:17A Semantic Priming Event-related Potential ERP Task to Study Lexico-semantic and Visuo-semantic Processing in Autism Spectrum Disorder
Published on: April 12, 2018
相关概念视频
Stereotype Content Model
Bias
In statistics, a sampling bias is created when a sample is collected from a population, and some members of the population are not as likely to be chosen as others (remember, each member...
In- and Out-Groups
Strategies for Assessing and Addressing Confounding
Confounding can be addressed at both the design phase of a study and through analytical methods after data...
Improving Translational Accuracy
Stereotypes, Prejudice, and Discrimination
