新的模式,旧的风险? 社会人口统计学偏见和敌对幻觉 在GPT-5中的脆弱性
Mahmud Omar1,2,3, Reem Agbareia1,2,3, Donald U Apakama1,2,3,4,5
1The Windreich Department of Artificial Intelligence and Human Health, Mount Sinai Medical Center, NY, USA.
与GPT-4o相比,GPT-5在社会人口统计学相关的医疗决策变异方面没有改善,对边缘化群体的偏见和在临床场景中对伪造细节的敏感性增加.
科学领域:
- 医疗保健中的人工智能
- 临床决策支持系统 临床决策支持系统
- 医学中的算法偏见.
背景情况:
- 像GPT-4o和GPT-5这样的大型语言模型 (LLM) 在医疗保健中越来越多地使用.
- 之前的工作建立了验证的基准测试,以评估LLMs的社会人口统计学相关决策变化.
- 有关临床环境中LLM输出的潜在偏见和可靠性存在担忧.
研究的目的:
- 与GPT-4o相比,评估GPT-5在社会人口统计学相关决策变化方面的表现.
- 评估GPT-5对伪造的医疗信息的敏感性和缓解.
- 确定由GPT-5产生的临床决策中的潜在偏差.
主要方法:
- 利用了500个医生验证的紧急情况图片,每个图片在32个社会人口统计标签和对照中进行了测试.
- 评估了四个关键的临床决策:分拣,进一步测试,治疗水平和心理健康评估.
- 进行了与伪造的医疗细节的对抗性重新运行,并测试了缓解提示.
主要成果:
- 与GPT-4o相比,GPT-5在社会人口统计学相关的决策变化方面没有表现出任何改善,在几个终点上表现更差.
- GPT-5重现了子组相关变异,将更高的紧迫性和不太先进的测试分配给边缘化群体.
- 在100%的GPT-5病例中,LGBTQIA+标签引发了心理健康查,而在GPT-4o病例中,这一比例为41-73%;在65%的对抗性病例中,GPT-5采用了伪造 (减轻后减少到7.67%).
结论:
- 在临床决策中的社会人口统计学偏见方面,GPT-5并没有改善GPT-4o.
- GPT-5对特定的社会人口统计学群体表现出显著的偏见,易受伪造信息的影响.
- 缓解策略对于提高临床应用中LLM的安全性和可靠性至关重要.
更多相关视频
13:08Measurement of Fronto-limbic Activity Using an Emotional Oddball Task in Children with Familial High Risk for Schizophrenia
Published on: December 2, 2015
06:58Highlighting and Reducing the Impact of Negative Aging Stereotypes During Older Adults' Cognitive Testing
Published on: January 24, 2020
相关概念视频
Positive Symptoms Schizophrenia: Hallucinations and Delusions
Hallucinations
Hallucinations in...
Stereotype Content Model
Psychological and Sociocultural Causes of Schizophrenia
Stereotypes, Prejudice, and Discrimination
Confirmation Biases
Stereotype Threat and Self-fulfilling Prophecies
