血液学案例解决中的大型语言模型:对ChatGPT-3.5,Google Bard和微软Bing进行比较研究
Amita Kumari1, Anita Kumari1, Amita Singh1
1Physiology, All India Institute of Medical Sciences, Deoghar, Deoghar, IND.
Cureus
|September 22, 2023
概括
大型语言模型 (LLM) 被评估为血液学案例问题解决. 聊天GPT-3.5表现最好,在准确性方面超过了谷歌巴德和微软Bing,尽管没有一个模型正确地回答了所有问题.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 血液学 血液学 血液学
背景情况:
- 大型语言模型 (LLM) 展示了广泛的自然语言处理 (NLP) 能力.
- 有限的研究存在于专业医学领域的LLM表现,如血液学.
- 本研究评估了领先的LLM在解决复杂的血液病例中的准确性.
研究的目的:
- 评估和比较ChatGPT-3.5,谷歌Bard和微软Bing在处理与血液学相关的病例细节方面的功能.
- 确定这些LLM在专业医疗领域的准确性和性能差异.
主要方法:
- 一项横截面研究策划了50个不同的血液病例,包括血液疾病,恶性瘤和治疗查询.
- 使用ChatGPT-3.5,谷歌Bard和微软Bing (Precise) 来回答策划的问题.
- 答案是专家评分 (生理学家,病理学家) 在一个5分级,并使用弗里德曼和一个样本的中位测试统计分析.
主要成果:
- 在LLM中观察到显著的绩效差异 (p < 0.0001).
- 聊天GPT-3.5获得了最高的平均得分 (3.15±1.19),明显超过了50%的合格率 (p=0.0004).
- 谷歌巴德 (2.23±1.17) 得分接近通过标志 (p=0.38),而微软的Bing (1.98±1.01) 得分明显低于 (p=0.0015).
结论:
- 与谷歌Bard和微软Bing相比,ChatGPT-3.5在解决血液病例小组中表现出卓越的性能.
- 虽然ChatGPT对医疗应用有希望,但目前没有任何LLM在这个领域拥有完全的准确性.
- 进一步的研究和模型优化对于推进医疗保健和医学教育中的LLM实用性至关重要.
关键词:
医疗保健中的人工智能和机器人聊天 聊天 聊天谷歌的巴尔德 (Bard) 是一个血液学疾病 血液学疾病血液学 血液学 血液学微软的Bing是什么意思自然语言处理自然语言处理.病理学家病理学家的病理学家病理学的病理学搜索引擎搜索引擎是什么更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
261
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
2.5K
