人与人工智能之间:评估AI文本检测工具的可靠性
Valentina Bellini1, Federico Semeraro2, Jonathan Montomoli3
1Anesthesiology, Critical Care and Pain Medicine Division, Department of Medicine and Surgery, University of Parma, Parma, Italy.
Current medical research and opinion
|January 24, 2024
概括
在线工具在检测ChatGPT-4生成文本的能力方面有所不同. 与GPTZero,ZeroGPT和Writer ACD相比,Originality在识别AI内容方面显示出更高的准确性,这凸显了需要改进AI检测方法的需要.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 数字法医学数字法医学
背景情况:
- 像ChatGPT-4这样的大型语言模型 (LLM) 在区分人工智能生成的内容和人类写作方面存在挑战.
- 越来越多的LLM需要可靠的方法来验证内容真实性,特别是在学术和科学背景下.
研究的目的:
- 评估各种在线检测工具在识别ChatGPT-4生成的文本方面的有效性.
- 为了比较GPTZero,ZeroGPT,Writer ACD和Originality在区分人工智能编写的内容和人类编写的文本方面的性能.
主要方法:
- 分析了三个文本:两个是通过ChatGPT-4生成的,具有不同的提示,一个是人类撰写的文本.
- 这些文本使用四种在线检测工具进行了评估:GPTZero,ZeroGPT,Writer ACD和Originality.
主要成果:
- 检测工具的性能差异很大.
- GPTZero和ZeroGPT在AI文本来源方面提供了不一致的结果.
- 作家ACD经常将文本归类为人类写的.
- 原创性始终识别了ChatGPT-4生成的内容,表明对AI模式的敏感性更高.
结论:
- 当前的自动检测工具在准确识别人工智能生成的文本方面显示出差异性.
- 需要更先进,更可靠的检测方法来确保内容完整性.
- 精细的检测工具对于防止错误分类人工智能生成和人类编写的内容至关重要.


