一项关于区分ChatGPT生成和人类撰写的骨科摘要的研究:解码差异
Konstantinos G Makiev1, Maria Asimakidou2, Ioannis S Vasios1
1Department of Orthopaedics, University General Hospital of Alexandroupolis, Democritus University of Thrace, Alexandroupoli, GRC.
Cureus
|December 22, 2023
概括
人类审稿人和人工智能检测器都难以可靠地区分人工智能生成的摘要和人类撰写的摘要,这对科学完整性构成风险. 在这项研究中,专业知识并没有显著提高检测准确度.
科学领域:
- 科学出版中的人工智能
- 学术沟通诚信学术沟通诚信
背景情况:
- 一个AI语言模型ChatGPT生成难以区分的人类类类型的文本.
- 人工智能在手稿起草中的使用越来越多,需要评估检测方法.
研究的目的:
- 评估人类审稿人区分人工智能生成和人类撰写摘要的能力.
- 评估当前人工智能检测工具的可靠性.
主要方法:
- 七名盲人审稿人 (骨科住院医生,教授和对照人) 评估了21篇摘要.
- 两个人工智能检测软件程序被用来分析抽象的作者身份.
- 一个结构化的采访评估了审稿人的决策过程.
主要成果:
- 人类审查员的准确性较低 (31.7-34.9%),非专家对照的表现更好 (76.2%).
- 人工智能探测器的准确性有限 (42.9%和66.6%).
- 所有人工智能生成的摘要都是100%独一无二的,没有抄袭.
结论:
- 目前的方法不足以可靠地检测人工智能生成的摘要.
- 专业知识不会显著影响检测准确度.
- 需要进一步的研究来确定可靠的AI抽象检测元素.


