人工智能与学术界:对人工智能文本检测器在行为健康学术写作中的准确性进行实验研究
Andrey A Popkov1,2, Tyson S Barrett1
1Highmark Health, Pittsburgh, PA, USA.
Accountability in research
|March 22, 2024
概括
人工智能检测工具在行为健康研究中识别人工智能生成的文本时显示出重大错误. 这些不准确性引发了人们对使用人工智能探测器来执行学术政策的担忧.
科学领域:
- 行为健康 行为健康
- 医疗信息学 医疗信息学
- 人工智能的人工智能
背景情况:
- 学术期刊越来越多地制定了人工智能 (AI) 生成文本的政策.
- 准确的AI检测工具对于执行这些政策和确保学术完整性至关重要.
- 现有研究表明,人工智能文本检测工具的精度可变.
研究的目的:
- 评估人工智能检测工具在行为健康出版物中区分人类撰写和人工智能生成文本的准确性.
- 评估免费和商业人工智能检测软件的性能.
主要方法:
- 这项研究分析了来自行为健康和精神病学期刊的100篇由人类撰写的研究文章 (2016-2018).
- 它还分析了200个人工智能生成的文本:来自ChatGPT的100个和来自Claude的100个.
- 测试了两个AI检测工具:一个免费的检测器和商业软件Originality.AI.AI.
主要成果:
- 免费的人工智能检测器错误地识别了平均27.2%的学术文本是人工智能生成的.
- 原创性.AI表现更好,但仍然难以准确检测Claude.AI生成的文本.
- 在这两种工具中都观察到有问题的虚假阳性和虚假阴性率.
结论:
- 当前的AI检测工具表现出显著的不准确性,包括高的假阳性和假阴性率.
- 这些工具在行为健康中对人工智能产生的内容实施严格政策的可靠性值得怀疑.
- 为了可靠的政策执行,需要进一步开发精确的AI检测方法.


