用低资源语言分析病理报告的GPT模型的系统比较:土耳其语的案例研究
Omer Faruk Dilbaz1, Muhammet Nusret Ozates2,3, Beyza Bolat4
1Department of Pathology, Sisli Hamidiye Etfal Health Application and Research Center, University of Health Sciences, Istanbul, Turkey.
American journal of clinical pathology
|September 19, 2025
概括
这项研究评估了土耳其外科病理学报告的大型语言模型 (LLM). GPT-4o在处理土耳其文本方面表现出卓越的性能,显示了在低资源语言中直接应用的潜力.
科学领域:
- 自然语言处理自然语言处理.
- 计算病理学计算病理学
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 显示出分析外科病理报告的前景.
- 目前的研究主要集中在英语上,忽视了低资源语言.
- 对土耳其病理学报告的LLMs缺乏系统的评估.
研究的目的:
- 评估各种LLM在处理土耳其外科病理学报告中的表现.
- 为了比较不同GPT模型 (GPT-3.5 Turbo,GPT-4o mini,GPT-4o) 对低资源语言的有效性.
- 调查快速优化和报告翻译对LLM准确性的影响.
主要方法:
- 分析了来自5项手术的759份土耳其病理学报告.
- 快速优化是使用10个实例进行的,用于GPT-3.5 Turbo,GPT-4o mini和GPT-4o.
- 在剩余的报告上测试了通用性,有或没有英语翻译.
主要成果:
- 在处理土耳其报告方面,GPT-4o的表现优于GPT-3.5 Turbo (12%-25%) 和GPT-4o mini (3%-16%).
- 英语翻译提高了GPT-3.5 Turbo和GPT-4o mini的准确性,而GPT-4o显示了类似的结果.
- 域特定提示提升了准确性;GPT-4o总体产生了最高的准确性.
结论:
- 这项研究是首次评估GPT模型在土耳其外科病理学报告上的性能.
- GPT-4o表现出高精度,提取的数据几乎准备好用于临床应用.
- 这些发现突显了LLM在低资源语言病理学报告分析方面的潜力.


