病理学领域特定知识的评估 聊天GPT的知识和与人类表现的比较
Andrew Y Wang1, Sherman Lin2, Christopher Tran2
1From the Schulich School of Medicine and Dentistry, Western University, London, Ontario, Canada (Wang, Wilsdon).
Archives of pathology & laboratory medicine
|January 20, 2024
概括
人工智能,特别是ChatGPT,在病理学方面表现有前途. GPT-4的表现优于工作人员病理学家,而GPT-3.5的表现类似,表明AI.
科学领域:
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
- 病理学 病理学 病理学
背景情况:
- 人工智能 (AI) 算法正在改变各种社会部门.
- 像ChatGPT这样的大型语言模型 (LLM) 展示了重要的特定领域知识,包括医学领域.
研究的目的:
- 为了评估ChatGPT的病理学领域特定知识.
- 为了比较GPT-3.5和GPT-4在回答病理学问题的表现.
主要方法:
- 15位病理学家生成了15个许可级病理学问题.
- GPT-3.5,GPT-4,和一个工作人员病理学家回答了问题.
- 审稿人对答案进行了评分,并确定了人工智能生成的答案.
主要成果:
- GPT-4的表现优于GPT-3.5和工作人员病理学家.
- 无论是GPT-3.5还是GPT-4,都在训练员的预期范围内得分.
- 在大多数情况下,审稿人可以识别GPT-3.5的答案.
结论:
- 聊天GPT在病理学方面表现出显著的潜力,GPT-4超过了人类的性能.
- 在未来,LLM可能会协助病理学家并加强培训.
- 先进的AI模型可以彻底改变病理学实践.


