探索ChatGPT-4在预测折射手术分类中的潜力:比较研究
Aleksandar Ćirković1, Toam Katz2
1Care Vision Germany, Ltd, Nuremberg, Germany.
JMIR formative research
|December 28, 2023
概括
聊天GPT-4显示了折射性手术患者预分类的潜力,与临床医生的评估达成了显著一致. 需要进行进一步的研究,以解决模型变异性,并提高临床实施的准确性.
科学领域:
- 眼科和人工智能的人工智能
- 医疗决策支持系统 医疗决策支持系统
- 折射手术 患者评估
背景情况:
- 人工智能 (AI),包括机器学习 (ML),通过改善患者风险评估和工作流程,正在推进折射手术.
- 像ChatGPT-4这样的大型语言模型 (LLM) 为各种应用提供了潜力,包括折射手术决策,但它们在现实世界中的有效性尚未得到证实.
研究的目的:
- 探索和验证ChatGPT-4在使用标准临床参数预分类折射手术患者的能力.
- 为了比较ChatGPT-4的批量输入分类性能与折射外科医生的分类性能.
- 用二进制 (适合/不适合激光手术) 和详细的分类方案来评估性能.
主要方法:
- 分析了来自100名折射手术患者的匿名数据,包括人口统计,折射,视力敏度和角膜成像 (Scheimpflug).
- 我们将ChatGPT-4的分类与使用科恩 κ系数,奇平方测试,混矩阵,准确度,精度,回忆,F1得分和ROC AUC的折射外科医生进行了比较.
主要成果:
- 在ChatGPT-4和临床医生分类之间观察到一个统计学上显著的一致性 (Cohen κ = 0.399用于6个类别,0.610用于二进制).
- 二元分类产生了更高的性能指标:准确度0.88,精度0.88,回忆0.88,F1得分0.88,和ROC AUC0.79.
- 该模型表现出时间不稳定性和响应变化,尽管通过六个类别的奇平方测试 (χ25=94.7,P<.001) 发现了显著的关联.
结论:
- 聊天GPT-4展示了作为折射性手术预分类工具的潜力,与专家临床医生达成了有前途的协议.
- 关键的局限性包括依赖单个评分器,小样本大小,输出不稳定性和模型不透明性,需要进一步调查.
- 未来的研究应该标准化提示和细节,确定混因素,并比较各种LLM,以促进验证和临床整合.


