评估基于人工智能的大型语言模型 (AI-LLM) 在解读遗传病理幻灯片和科学数据方面的能力:性能评估研究
Khanisyah E Gumilar1,2, Grace Ariani3, Priangga A Wiratama3
1Graduate Institute of Biomedical Science, China Medical University, Taichung, Taiwan, ROC.
BioMedicine
|March 9, 2026
概括
与其他AI-LLMs相比,ChatGPT-4在解释病原体和科学图像方面表现出卓越的表现. 这一进步有可能改善医学诊断和加强科学教育.
科学领域:
- 生物分子科学 生物分子科学
- 医学成像分析 医学成像分析
- 医疗保健中的人工智能
背景情况:
- 人工智能大语言模型 (AI-LLM) 是复杂科学任务的新兴工具.
- AI-LLM可以提高科学信息的理解和可访问性,帮助专业人士和学生.
- 应用包括解释组织病理学幻灯片和用于诊断和教育的科学数字.
研究的目的:
- 评估AI-LLM在解读基因病理幻灯片和科学图像方面的能力.
- 评估AI-LLM在支持诊断和提高生物分子科学理解方面的表现.
主要方法:
- 两部分研究:解读组织病理学幻灯片和科学数据.
- 三个领先的聊天机器人 (ChatGPT-4,Gemini Advanced,Copilot) 在每张12张图像上进行了测试.
- 专家评级人员使用5分利克特级别对相关性,清晰度,深度,重点和连贯性进行了评估;统计分析包括ANOVA和回归.
主要成果:
- 聊天GPT-4在解释基因病理和科学图像方面明显优于双子星高级和副驾驶 (P < 0.001).
- 聊天GPT-4在所有评估参数中获得了更高的分数:相关性,清晰度,深度,重点和连贯性.
- 卓越的性能归因于先进的算法,广泛的训练数据,专门的模块和用户反.
结论:
- 聊天GPT-4在科学图像解释方面表现出色,有可能提高诊断准确度并减少病理学家的工作量.
- 增强对复杂图像的理解有利于学生,并促进交互式学习.
- 聊天GPT-4显示了改善患者护理和丰富教育经验的巨大潜力.


