人工智能与人类触摸:人工智能可以准确地生成关于激光技术的文献评论吗?
Frédéric Panthier1,2,3,4, Hugh Crawford-Smith5, Eduarda Alvarez5,6
1Department of Urology, Westmoreland Street Hospital, UCLH NHS Foundation Trust, 16-18 Westmoreland Street, Marylebone, London, W1G 8PH, UK. fredericpanthier@gmail.com.
World journal of urology
|October 28, 2024
概括
人类作者对脉冲的Thulium:YAG激光器进行了更准确的系统审查,而不是人工智能 (AI) 大语言模型 (LLM). 虽然LLM的准确性较低,但像ChatGPT3.5这样的人工智能工具,在人类监督下,可能会增强医疗实践.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 泌尿器科 激光技术 激光技术
背景情况:
- 系统性审查 (SRs) 对基于证据的医学至关重要.
- 人工智能 (AI) 大型语言模型 (LLM) 的出现为自动化文献合成提供了潜力.
- 由LLM生成的SRs的准确性,特别是在像脉冲图:YAG (p-Tm:YAG) 激光器这样的专业主题上,需要严格的评估.
研究的目的:
- 为了比较开源AI LLMs与人类作者在生成p-Tm:YAG激光系统审查中的准确性.
- 评估不同LLM (ChatGPT3.5,Vercel,Claude,Mistral-7b) 在合成技术医学文献方面的表现.
主要方法:
- 在p-Tm:YAG激光器上,人类创作的SR被认为是基本真理,与四个LLM产生的SR进行了比较.
- 九名内分泌学专家客观和主观地评估了五个SR的准确性,质量和清晰度,使用标准化的proforma和评分系统.
- 由LLM生成的SRs被重新格式化,以确保对评估人员的盲目化.
主要成果:
- 与LLM生成的SR相比,由人类编写的SR显示出明显更高的客观 (96% ± 7%) 和主观 (86.8% ± 8.2%) 准确性 (p < 0.001).
- 在LLM生成的SR中没有发现准确度的显著差异,尽管ChatGPT3.5显示得分略高.
- SR类型对质量和清晰度评估产生了重大影响,而评估人员的专业知识水平则没有.
结论:
- 与人类专家相比,AI LLM 在高度技术主题上产生更低准确度的系统审查.
- 在使用LLM生成的数据时,人类监督是必不可少的,特别是在专门的医疗主题上.
- 人工智能工具,特别是ChatGPT3.5,当与人类专业知识相结合时,有可能改善临床实践.


