耳鼻喉科住院招生中的大型语言模型:随机抽样分析
Akash S Halagur1,2, Karthik Balakrishnan3, Noel Ayoub4
1Department of Otolaryngology-Head & Neck Surgery, Stanford University School of Medicine, Stanford, California, U.S.A.
The Laryngoscope
|August 19, 2024
概括
人工智能 (AI) 模拟揭示了耳鼻喉科住院选择中的显著人口偏见. 人工智能模型和模拟委员会成员都显示出偏好,强调需要解决人工智能驱动的选择过程中的偏见.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 健康 公平 卫生 公平
背景情况:
- 耳鼻喉科的住院选择委员会 (RSC) 旨在提供公正的评估.
- 人工智能 (AI) 越来越多地被用于医学教育和选择中的应用.
研究的目的:
- 在人工智能驱动的对耳鼻喉科住院选择的模拟中调查人口偏见.
- 评估像GPT-4和GPT-4o这样的AI模型是否表现出与人类评审者类似的偏见.
主要方法:
- 模拟的RSC成员具有不同的人口结构使用API与GPT-4和GPT-4o进行交互.
- 评估了10名具有相同资格但不同人口统计数据的申请人.
- 每个RSC运行了1000次模拟,基平方测试分析了偏差,GPT-4o提供了理由.
主要成果:
- 模拟的RSC显示出明显的种族,性别和性取向偏见 (p < 0.05).
- 广播公司对具有共同的人口特征的申请人表现出偏好;亚洲男性申请人选择率最低.
- GPT-4o偏爱黑人女性和LGBTQIA+申请人,在超过95%的决策中引用了包容性.
结论:
- 公共可用的大型语言模型 (LLM) 可能会对耳鼻喉科住院选择产生重大偏见.
- 在LLMs中不断变化的性质和潜在的偏见需要仔细考虑和缓解策略.
- 尽量减少LLM偏见对于培养多样化和代表性的耳鼻喉科工作人员至关重要.


