相关实验视频
Updated: Jun 12, 2025

08:50
Predictive Immune Modeling of Solid Tumors
Published on: February 25, 2020
6.9K
评估大语言模型的准确性和完整性:免疫检查点抑制剂及其眼睛毒性
Camellia Edalat1, Nila Kirupaharan1, Lauren A Dalvin2
1The Drexel University College of Medicine, Philadelphia, Pennsylvania.
Retina (Philadelphia, Pa.)
|September 23, 2024
概括
三个大型语言模型 (LLM) 准确而彻底地回答了关于免疫检查点抑制剂眼部毒性的问题. 对于特定的代理和更新的LLM版本,需要进一步的研究.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 在瘤学瘤学.
背景情况:
- 免疫检查点抑制剂 (ICI) 在癌症治疗中至关重要.
- 眼部毒性是ICI的一种已知的副作用.
- 准确的信息对于管理这些毒性至关重要.
研究的目的:
- 评估三种大型语言模型 (LLM) 在提供关于ICI相关眼睛毒性的信息时的准确性和完整性.
- 为了比较ChatGPT 4.0,Bard和LLaMA在这个领域的性能.
主要方法:
- 对三个LLM提出了八个问题,涵盖ICI定义,机制,眼睛毒性和管理.
- 四名眼科医生使用六分利克特尺度对答案的准确性和完整性进行评分.
- 统计分析包括ANOVA和双向t-测试,与Fleiss kappa进行interrater可靠性.
主要成果:
- 这三个LLM都表现出高准确度 (平均得分为4.38-4.59) 和完整性 (平均得分为4.03-4.19).
- 在LLMs中没有发现准确度 (P=0.47) 或完整度 (P=0.86) 的显著差异.
- 准确性和完整性之间的可靠性很差 (弗莱斯卡帕分别为-0.03和0.01).
结论:
- LLM提供了关于ICI眼部毒性及其管理的高度准确和完整的信息.
- 未来的研究应该专注于特定的ICI和较新的LLM版本.
- 虽然LLM很有希望,但临床判断仍然至关重要.

