不同的人工智能语言模型如何向患者提供有关静脉静脉的射频切除的信息?
Ayman Zyada1, Ayman Fakhry2, Sohiel Nagib3
1Vascular Surgery, University Hospitals of Leicester National Health Service (NHS) Trust, Leicester, GBR.
Cureus
|July 23, 2025
概括
格罗克-3和ChatGPT-4提供了最好的人工智能生成的患者教育,用于静脉缩的射频切除. 虽然人工智能显示出前景,但在广泛临床使用之前,进一步评估至关重要.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 血管外科 血管外科
背景情况:
- 越来越多的公众依赖人工智能 (AI) 和大型语言模型 (LLM) 来获取医疗信息.
- 关于人工智能产生的医疗建议的准确性和清晰性的不确定性,特别是对于诸如静脉缩的射频切除 (RFA) 等程序.
研究的目的:
- 评估和比较领先的LLM关于静脉变的射频剥离 (RFA) 的AI生成响应的质量.
- 评估AI的可靠性,清晰性和有用性,以回答有关RFA的常见患者问题,根据专家血管外科医生的判断.
主要方法:
- 这是一项盲目的,比较的观察性研究,涉及32名血管外科医生.
- 针对静脉的RFA提出了标准化的问题,对五个顶级的LLM提出:ChatGPT-4,DeepSeek-R1,Gemini 2.0,Grok-3和LLaMA 3.1.
- 外科医生根据准确性,清晰性,相关性和深度评估反应,并使用统计分析 (弗里德曼,威尔科克森签名级别测试) 来确定性能.
主要成果:
- 在51.6%的病例中,Grok-3提供了最高质量的反应,显著超过其他模型 (p < 0.0001).
- 聊天GPT-4排名第二 (23.1%),而Gemini,DeepSeek和LLaMA表现相似,但表现较差.
- Grok-3在程序风险和程序后护理反应方面表现出色,而ChatGPT-4在入门信息方面表现最好. 很大一部分外科医生仍然犹是否推人工智能工具.
结论:
- 目前,Grok-3和ChatGPT-4提供了最可靠的人工智能生成的患者教育,用于静脉缩的射频切除 (RFA).
- 人工智能工具显示出提高患者理解和减少医生工作负担的潜力,但需要持续评估和谨慎整合.
- 这项研究为未来在医疗应用中对人工智能技术进行比较提供了一个基准.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.3K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
690
