在临床决策中评估生成预训练变压器 (GPT):对GPT-3.5和GPT-4进行比较分析
Adi Lahat1,2, Kassem Sharif1,3, Narmin Zoabi1
1Department of Gastroenterology, Chaim Sheba Medical Center, Affiliated with Tel Aviv University, Ramat Gan, Israel.
Journal of medical Internet research
|June 27, 2024
概括
这项研究表明,像ChatGPT-4这样的先进AI聊天机器人可以有效地帮助医生解决复杂的临床和伦理问题,专家医生对他们的表现进行了高度评价. 虽然人工智能为诊断和治疗提供了有希望的支持,但它应该增强,而不是取代人类的医疗专业知识.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持系统 临床决策支持系统
背景情况:
- 人工智能 (AI) 和聊天机器人系统在医疗保健中越来越重要,用于临床决策和患者参与.
- 在复杂的医疗场景中评估AI的性能对于安全集成至关重要.
研究的目的:
- 分析ChatGPT-3.5和ChatGPT-4在解决复杂的临床和道德困境方面的表现.
- 为了比较高级医生和住院医生对人工智能产生的反应的评分.
- 根据问题类型识别绩效差异.
主要方法:
- 176个现实世界的临床问题由4位专业医生制定.
- 8名高级医生和住院医生评估了GPT-3.5和GPT-4对准确性,相关性,清晰性,实用性和全面性的反应.
- 评估涵盖了内部医学,急诊医学和伦理学,在全球范围内进行比较,在经验水平之间以及按问题类型进行比较.
主要成果:
- 这两种GPT模型均获得高平均分 (GPT-4:4.4,GPT-3.5:4.1).
- 在所有指标上,GPT-4的表现始终优于GPT-3.5.
- 高级医生对这两种模型的评价都高于住院医生,特别是对GPT-4的好处和完整性 (P<.001).
- 伦理查询在两种模式中都获得了最高的评分.
结论:
- 聊天GPT显示出有很大的潜力来帮助医生在诊断,治疗和道德方面的考虑.
- 在临床工作流程中整合人工智能应该补充,而不是取代人类的专业知识.
- 为了安全有效的临床实施,需要进一步的研究.
关键词:
在这里,我们可以看到AIAIAI.聊天GPT 聊天GPT 的意思一个ED医生.医学 EM EM 医学 EM 医学ML ML ML 在这里.在NLP中,我们使用了NLP.算法算法是一种算法.算法算法是一种算法.人工智能的人工智能是人工智能.生物伦理学生物伦理学聊天-GPT 的时间.聊天机器人 聊天机器人聊天机器人是一个聊天机器人.聊天机器人 聊天机器人聊天机器人聊天机器人聊天机器人紧急医生的医生紧急医生紧急医疗 紧急医疗紧急医生紧急医生这是道德上的道德.伦理上的困境 伦理上的困境伦理上的困境 伦理上的困境伦理学 伦理 伦理学内部医学是内科的专业.机器学习是机器学习.自然语言处理自然语言处理.实用模型实用模型模型实用模型实用模型实用模型预测分析 预测分析预测模型是一个预测模型.预测模型的预测模型.预测系统 预测系统

