在整形手术中评估人工智能生成内容的检测精度:对医疗专业人员和人工智能工具的比较研究
Keenan S Fine1, Emily E Zona1, Aidan W O'Shea1
1From the Division of Plastic and Reconstructive Surgery, University of Wisconsin School of Medicine and Public Health.
Plastic and reconstructive surgery
|June 10, 2025
概括
医疗专业人员和人工智能检测工具都在努力识别人工智能 (AI) 产生的科学内容. 当前的人工智能工具显示出高的区分能力,但经常错误地分类人类写作,需要改进的检测方法.
科学领域:
- 医学写作 医学写作
- 科学中的人工智能.
- 科学完整性 科学完整性
背景情况:
- 越来越多的人工智能 (AI) 在学术写作中的使用对科学出版物的完整性构成风险.
- 人类撰写和人工智能生成的内容之间的区别变得越来越具有挑战性.
- 这项研究专门研究了在整形外科领域的AI检测文献.
研究的目的:
- 评估医疗专业人员在识别科学写作中人工智能产生的内容方面的有效性.
- 评估人工智能检测工具在区分人类写的和人工智能生成的段落方面的性能.
- 分析人工智能内容检测人类和自动化方法的准确性和可靠性.
主要方法:
- 评估了八个手稿段落 (四个与整形外科相关),分类为人类撰写,人工智能编辑或完全由人工智能生成.
- 24名医疗评分员 (从学生到医务人员) 分类了通道来源.
- 使用三个在线人工智能检测工具分析段落,通过接收器运行特征曲线分析评估它们的准确性.
主要成果:
- 评级人员在识别通道来源时的准确性低 (26.5%),特别难以区分人工智能生成的内容 (34.4%) 和人类撰写的内容 (14.5%).
- 在人类评级者中,评级者之间的可靠性很差 (Fleiss kappa = 0.078).
- 人工智能检测工具显示出高的区分能力 (AUC = 0.962),但经常出现错误阳性 (25%-50%) 和工具之间的低一致性 (ICC = -0.118).
结论:
- 医疗专业人员和当前的人工智能检测工具在可靠识别人工智能生成的科学内容方面面临着重大挑战.
- 人工智能检测工具虽然强大,但容易错误分类人类撰写的材料.
- 改进的方法对于维护科学写作完整性和防止错误的窃指控至关重要.


