人工智能能欺骗住院委员会吗? 推信的随机多中心分析
Samuel K Simister1, Eric G Huish, Eugene Y Tsai
1From the University of California, Davis, Sacramento, CA (Simister, Le, Meehan, Leshikar, Saiz, and Lum), the San Joaquin General Hospital, French Camp, CA (Huish), the Cedars Sinai, Los Angeles, CA (Tsai), and the Yale University, New Haven, CT (Halim and Tuason).
生成型人工智能 (AI) 可以产生与人类作者无法区分的推信 (LOR). 居住选择委员会努力区分人工智能产生的LOR,影响申请评估.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 外科住院招生入学情况
背景情况:
- 生成型人工智能 (AI) 在医学教育中带来了新的挑战和机遇,特别是在医疗执业申请方面.
- 人工智能的日益复杂化需要对其对传统应用组件 (如推信) 的影响进行评估.
研究的目的:
- 评估整形外科住院选择委员会成员在人写和人工智能生成的推信 (LOR) 之间辨别能力.
- 与人类作者相比,评估识别来自各种平台 (ChatGPT,Google BARD) 的AI生成LOR的准确性.
主要方法:
- 这是一项多中心,单盲试验,涉及45个LOR (15人,15个ChatGPT,15个Google BARD).
- 来自四个实习生计划的七名教师评审员根据11个标准化特征评估了LOR,并在1-10级别上对申请人进行了排名.
- 统计分析包括顺序回归和接收器操作特征 (ROC) 曲线,以确定确定AI作者身份的准确性.
主要成果:
- 教师评论员错误地识别了AI生成的信件63%,人类生成的信件40%的时间.
- 随着时间的推移,没有观察到识别准确度的显著增加.
- 与人类作者相比,Google BARD在准确性,适应性和感知承诺方面表现优越.
结论:
- 教师无法可靠地区分人类和人工智能生成的LOR,这表明AI有能力产生类似的推信.
- 这些发现强调了居住选拔委员会需要重新评估LOR在申请过程中的作用和权重.
- 需要进一步的研究来开发可靠的方法来验证LOR在AI时代的真实性.
更多相关视频
06:05Employing Transcranial Magnetic Stimulation in a Resource Limited Environment to Establish Brain-Behavior Relationships
Published on: April 20, 2022
07:10Depletion of Mouse Cells from Human Tumor Xenografts Significantly Improves Downstream Analysis of Target Cells
Published on: July 29, 2016
相关概念视频
Ethics in Research
False Memories
One primary source of false memories is misattribution, where individuals incorrectly associate external information...
The Representativeness Heuristic
Stereotype Threat and Self-fulfilling Prophecies
Ethical Dilemmas II
Stereotype Content Model
