更快,更好一些吗? :测试用于神经外科文献分析的人工智能准确性
Serkan Civlan1, Berk Burak Berker2, Defne Şahinoğlu Berker2
1Department of Neurosurgery, Pamukkale University, School of Medicine, Denizli, Türkiye.
Medicine
|December 16, 2025
概括
在解释神经外科研究文章时,ChatPDF显示了89%的准确性,显示了作为学术任务的AI工具的潜力. 然而,由于来源可靠性不一致,手动验证至关重要.
科学领域:
- 神经外科 神经外科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 像ChatPDF这样的人工智能 (AI) 工具为神经外科学术任务提供了潜在的潜力.
- 需要对人工智能工具在专业领域的准确性和相关性进行批判性评估.
研究的目的:
- 评估ChatPDF在解释神经外科研究文章中的准确性和可靠性.
- 确定ChatPDF用于神经外科文献审查的优点和局限性.
主要方法:
- 从十大神经外科期刊 (2023卷) 中选出的原创研究文章.
- 每篇文章生成10个由研究人员提出的问题.
- 将文章上传到ChatPDF以生成问题和提供答案.
- 评估响应准确性 (完全正确,部分正确,不正确) 和来源可靠性.
主要成果:
- 在100个问题中,ChatPDF实现了89%的整体准确率.
- 89%的答案是完全正确的,5%是部分正确的,6%是不正确的.
- 平均来源可靠性为83%,在各期刊之间存在明显的变化.
结论:
- ChatPDF显示了相当大的准确性和潜力,作为神经外科文献审查的补充工具.
- 限制包括不一致的来源可靠性和无法分析视觉内容.
- 手动验证对于神经外科研究的全面和准确解释至关重要.


