研究生成性AI模型和检测技术:代币化和数据集大小对识别人工智能生成的文本的影响
1The Culver Academies, Culver, IN, United States.
Frontiers in artificial intelligence
|December 4, 2024
概括
这项研究评估了学术写作中的生成AI文本检测,比较机器学习和大型语言模型. 调查结果为打击教育评估中人工智能辅助作弊的策略提供了信息.
科学领域:
- 人工智能的人工智能
- 教育 技术 技术 教育 技术
- 自然语言处理自然语言处理.
背景情况:
- 生成型人工智能 (例如,ChatGPT,Gemini,Claude) 提供了教育方面的好处,但也引起了人们对学术不诚实的担忧.
- 现有的AI文本检测器与修改的AI内容和非母语英语使用者扎.
- 在高风险的写作评估中检测人工智能生成的文本至关重要.
研究的目的:
- 调查各种机器学习和大型语言模型在检测人工智能生成的学术写作的有效性.
- 为了比较不同的人工智能模型和检测技术的性能,包括那些处理释的技术.
- 探索数据集大小对检测模型性能的影响.
主要方法:
- 使用了经典的机器学习模型 (逻辑回归,XGBoost,SVM) 和大型语言模型 (BERT,RoBERTa,Electra).
- 使用各种AI模型 (ChatGPT,Claude,Gemini) 分析了ASAP Kaggle竞赛 (提示1) 的文章.
- 集成的重述工具 (GPT-Humanizer,QuillBot) 和一种基于同义词的新型检测方法.
主要成果:
- 对比传统机器学习与高级大型语言模型在识别人工智能生成文本方面的有效性.
- 评估了对表述工具对检测准确性的影响.
- 检查了数据集大小与检测算法的性能之间的相关性.
结论:
- 机器学习和大型语言模型显示了检测人工智能生成的学术工作的潜力.
- 释工具带来了挑战,需要先进的检测方法,如同义词分析.
- 数据集的大小显著影响模型性能,指导未来的研究和数据收集策略.


