人与机器:识别在妇科和泌尿科医学的ChatGPT生成的摘要
Evelyn T Pan1, Maria Florian-Rodriguez1
1Division of Urogynecology and Reconstructive Pelvic Surgery, Department of Obstetrics and Gynecology, University of Texas Southwestern Medical Center, Dallas, TX.
American journal of obstetrics and gynecology
|May 6, 2024
概括
人类审稿人很难识别人工智能生成的摘要,人工智能检测软件显示不完整的准确性. 人工智能在科学写作和审查过程中的使用需要指导方针.
科学领域:
- 医学研究 医学研究
- 医学中的人工智能
- 科学写作 科学写作
背景情况:
- 聊天GPT,一个可访问的AI语言模型,越来越多地用于医学研究.
- 医学界需要了解人工智能的能力,道德和对著作权的影响.
- 有关人工智能写作质量,准确性和在科学背景下检测存在不确定性.
研究的目的:
- 为了比较人类审查员和人工智能检测软件识别人工智能生成的妇科和泌尿科医学的摘要的能力.
- 分析原始和人工智能生成的摘要之间的写作错误,可读性和质量的差异.
主要方法:
- 25个原始摘要和25个人工智能生成的摘要 (使用ChatGPT) 从妇科医生和泌尿科医生期刊中进行了选择.
- 盲目的教师和研究员审查了摘要,以确定它们的来源 (人类或人工智能).
- 人工智能检测软件 (GPTZero,Originality,Copyleaks) 和Grammarly被用于分析.
主要成果:
- 人类审稿人仅正确识别了总体上49.7%的摘要.
- 人工智能检测器更有可能标记人工智能生成的摘要 (73.3%GPTZero,98.1%原创性,58.2%Copyleaks),而不是原始的摘要.
- 语法识别了原始摘要中更多的写作错误,表明与人工智能生成的文本相比质量较差.
结论:
- 人类审稿人无法可靠地区分人工智能生成的科学文本,因为它的现实主义.
- 人工智能检测软件看起来很有前途,但需要改进以获得最佳准确性.
- 随着人工智能采用率的增长,人工智能在稿件审查中使用和检测的明确准则至关重要.


