大型语言模型对肝癌监测,诊断和管理问题的反应:准确性,可靠性,可读性
Jennie J Cao1, Daniel H Kwon2, Tara T Ghaziani3
1Department of Radiology, Stanford University School of Medicine, 300 Pasteur Drive, Room H-1307, Stanford, CA, 94305, USA.
Abdominal radiology (New York)
|August 1, 2024
概括
大型语言模型 (LLM) 在回答有关肝细胞癌诊断和管理的基本问题时显示出有限的准确性和可靠性. 他们的回应往往复杂且难以阅读.
科学领域:
- 人工智能在医学中的应用
- 在瘤学瘤学.
- 肝细胞癌研究 肝细胞癌研究
背景情况:
- 大型语言模型 (LLM) 越来越多地用于医疗信息检索.
- 在瘤学等专业领域的LLM答案的准确性和可靠性需要彻底评估.
- 肝细胞癌 (HCC) 的诊断和管理涉及复杂的医疗信息.
研究的目的:
- 评估著名的LLM (ChatGPT-3.5,Gemini,Bing) 的准确性,可靠性和可读性,用于HCC诊断和管理查询.
- 为了比较不同LLM在提供临床相关信息的性能.
主要方法:
- 对ChatGPT-3.5,Gemini和Bing提出了关于HCC诊断和管理的20个基本问题.
- 答案的准确性和可靠性由六位经过奖学金培训的医生评估.
- 使用Flesch阅读易度得分和Flesch-Kincaid等级水平量化可读性.
主要成果:
- 在聊天机器人之间没有发现准确度的显著差异.
- 双胞胎为60%的问题提供了准确的答案,其次是ChatGPT (45%) 和Bing (30%).
- 可读性各不相同,ChatGPT是最难读的 (Flesch阅读易度得分29),Bing是最难读的 (40).
结论:
- 课程提供复杂的答案,基本的HCC问题往往不是准确或可靠的.
- 医学主题的LLM答案的可读性需要改善,以获得临床实用性.
- 需要进一步的研究来提高医疗应用中LLM的准确性和清晰度.
更多相关视频
12:24A Three-Dimensional Spheroid Model to Investigate the Tumor-Stromal Interaction in Hepatocellular Carcinoma
Published on: September 30, 2021
5.1K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
