用于识别人工智能合成的学术文章的比较探测器分析在眼科领域
1Department of Ophthalmology, Kocaeli State Hospital, Kocaeli, Türkiye.
Beyoglu eye journal
|October 8, 2025
概括
人工智能 (AI) 可以生成学术文本,引发伦理方面的担忧. 虽然人工智能检测器显示出前景,但转述人工智能生成的内容显著降低了检测准确度,需要改进策略.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 学术诚信 学术诚信
背景情况:
- 在学术写作中,像ChatGPT这样的大型语言模型 (LLM) 的扩散带来了重大的伦理挑战.
- 人工智能产生现实的,基于证据的学术文本的能力需要对控制机制进行检查.
研究的目的:
- 探索人工智能生成的学术文本所带来的挑战.
- 评估当前人工智能检测工具在区分人工智能生成的内容与原始作品方面的有效性.
- 评估文本操纵对AI检测准确性的影响.
主要方法:
- 聊天GPT-4o从150篇原创眼科文章中生成了50个介绍部分.
- 人工智能生成和原始文本使用人工智能检测器 (GPTZero,Writer,CorrectorApp,ZeroGPT) 和抄袭检测器进行分析.
- 评估了人工智能检测器在区分原始文本和人工智能生成文本方面的准确性.
主要成果:
- 在原始文本和人工智能生成文本之间的AI检测器概率中观察到一个统计学上显著的差异 (p<0.001).
- GPTZero实现了100%的灵敏度和96%的特异性,优于其他探测器.
- 将人工智能生成的文本转述,显著降低了GPTZero的检测准确性 (p<0.001).
结论:
- 聊天GPT-4o可以快速合成可引用的学术文本,绕过抄袭检查器.
- 人工智能检测器有局限性,偶尔会错误地分类原始文本.
- 简单的重述损害了人工智能检测,强调了先进检测和道德准则的必要性.


