评估大型语言模型 (LLM) 在妇科瘤学的决策支持中
Khanisyah Erza Gumilar1,2, Birama R Indraprasta3, Ach Salman Faridzi3
1Graduate Institute of Biomedical Science, China Medical University, Taichung, Taiwan.
Computational and structural biotechnology journal
|November 29, 2024
概括
双子座高级 (GemAdv) 在妇科瘤学方面显示出强大的潜力,为复杂的癌症病例提供准确和一致的答案. 为了实现最佳的临床整合,需要进一步开发.
科学领域:
- 人工智能在医学中的应用
- 瘤学的决策支持
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 正在迅速发展,需要严格的评估以确保安全的临床整合.
- 评估LLM的可靠性和准确性对于支持医疗专业人员在复杂的案例工作中至关重要.
- 确保LLM在妇科瘤学等专业领域的表现对于其采用至关重要.
研究的目的:
- 在复杂的妇科癌症病例中调查突出的大型语言模型 (LLM) 的准确性和一致性.
- 在临床决策背景下评估ChatGPT-4,Gemini Advanced和Copilot的性能.
- 确定LLMs的适合性,以支持妇科瘤学家.
主要方法:
- 三个LLM (ChatGPT-4,Gemini Advanced,Copilot) 用15个临床小题和5个开放式问题进行了评估.
- 答案被六位专家妇科瘤学家在五分利克尔特尺度上盲目评估.
- 这些指标包括准确性,一致性,相关性,清晰度,深度,重点和连贯性.
主要成果:
- 与ChatGPT-4 (61.60%) 和Copilot (70.67%) 相比,Gemini Advanced显示出更高的准确性 (81.87%).
- 双子先进始终提供正确答案更频繁 (>60%每天).
- 虽然ChatGPT-4在遵守NCCN指南方面略有优势,但Gemini Advanced在答案深度和焦点方面表现出色.
结论:
- 士学位,特别是双子星高级学位,有望通过准确和一致的信息来支持妇科瘤学的临床实践.
- 为了处理高度复杂的妇科癌症情景,需要进一步改进LLM.
- 持续的开发和严格的评估对于最大限度地提高LLM在瘤学中的临床实用性和可靠性至关重要.


