相关实验视频
Updated: Jun 21, 2025

10:10
Reverse Total Shoulder Arthroplasty
Published on: July 5, 2011
43.2K
在肩膀和肘部手术中识别ChatGPT生成的摘要对审查者来说是一个挑战
Ryan D Stadler1, Suleiman Y Sudah2, Michael A Moverman3
1Rutgers Robert Wood Johnson Medical School, New Brunswick, New Jersey, U.S.A..
概括
经验丰富的评论员在肩膀和肘部手术中努力识别人工智能 (AI) 产生的研究摘要. 不现实的数据有助于人工智能检测,而写作风格导致了原始摘要的错误分类.
科学领域:
- 整形外科手术 整形外科手术
- 医学研究 医学研究
- 人工智能在医学中的应用
背景情况:
- 人工智能 (AI) 的进步需要评估其对科学出版物的影响.
- 了解人工智能产生的内容的可检测性对于保持研究完整性至关重要.
研究的目的:
- 评估经验丰富的审查员在肩膀和肘部手术中区分人工智能产生的原始研究摘要的能力.
- 将人类评审员的表现与人工智能检测工具 (GPTZero) 进行比较.
主要方法:
- 来自高影响力期刊的50篇摘要 (25篇原创,25篇人工智能生成) 被8位盲目,经验丰富的同行评审员评估.
- 评审者使用利克特级别来表示信心,并为他们的分类提供了理由.
- 来自GPTZero的AI检测得分被分析为原始和人工智能生成的摘要.
主要成果:
- 评论员正确识别了62%的AI生成的摘要,但错误地将38%的原始摘要归类为AI生成的.
- 在生成的摘要中,GPTZero显示了人工智能输出的可能性明显更高 (中位数为56%) 与原始摘要 (中位数为10%).
- 与原始摘要 (中位数82%) 相比,人工智能生成的摘要的抄袭得分较低 (中位数7%).
结论:
- 人类和人工智能生成的科学内容之间的区别仍然是骨科手术经验丰富的审查员面临的挑战.
- 不切实际数据的存在是识别人工智能生成摘要的关键指标.
- 写作风格是导致原始摘要被错误分类为人工智能生成的主要因素.

