多模式大语言模型作为甲状腺结节恶性瘤风险的端到端分类器:可用性研究
Gerald Gui Ren Sng1,2, Yi Xiang3, Daniel Yan Zheng Lim2,4
1Department of Endocrinology, Singapore General Hospital, 20 College Road, Academia Level 3, Singapore, 169856, Singapore, 65 63214377.
JMIR formative research
|August 19, 2025
概括
多模式大语言模型 (LLM) 显示了甲状腺结节风险分层的潜力,但准确性仍然不足于临床使用的最佳水平. 商业型号提供更好的一致性,而快速工程提高了可靠性.
科学领域:
- 医疗成像中的人工智能
- 多模式大型语言模型 (LLM)
- 甲状腺结节诊断 甲状腺结节诊断
背景情况:
- 甲状腺结节通常通过超声波成像进行评估.
- 目前的风险分层系统 (例如,ACR TI-RADS) 面临着观察者之间的变化和低特异性的挑战.
- 多模式的LLM提供了提高诊断效率的潜力,但需要验证.
研究的目的:
- 用ACR TI-RADS系统评估甲状腺结节风险分层的多式LLM的准确性和一致性.
- 评估微调,图像注释和提示工程对LLM绩效的影响.
- 为了比较开源LLMs与商业多式联络LLMs的性能.
主要方法:
- 评估了三个多模式的LLM:LLaVA,LLaVA-Med和OpenAI的o3模型.
- 从公共超声数据集中评估了192个甲状腺结节.
- 模型使用基本和修改提示,以及未标记与注释图像进行了测试,产生了6912个响应.
主要成果:
- 商业的o3模型显示了最高的有效性 (98.6%) 和准确性 (高达57.3%),尽管仍然不够理想.
- 快速工程提高了组合的精度,但减少了形状,边缘和整体分类的精度.
- 图像标记与LLaVA模型对结节边缘的准确性略有提高;一致性在o3中最高,并且在标记/修改提示时得到改善.
结论:
- 多模式LLM显示出希望,但需要进一步开发,以便在甲状腺成像中可靠的临床整合.
- 商业模型目前在准确性和一致性方面优于开源选项.
- 快速工程显著提高了一致性,特别是在商业模型中,突出了其对优化的重要性.
更多相关视频
07:13Comparison of Predictive Performance of Three Lymph Node Staging Systems in Colorectal Signet Ring Cell Carcinoma Based on Machine Learning Model
Published on: April 18, 2025
193
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
681
