对布鲁克斯症知识的三大语言模型进行比较分析
Elisa Souza Camargo1, Isabella Christina Costa Quadras1, Roberto Ramos Garanhani2
1Graduate Program in Dentistry, Pontifícia Universidade Católica do Paraná, Curitiba, Brazil.
Journal of oral rehabilitation
|February 6, 2025
概括
大型语言模型 (LLM) 在回答布鲁克斯主义问题时表现出中度准确性和高一致性. 虽然双子座提供了更好的可读性,但人工智能工具不应该取代专业牙医的布鲁克斯症建议.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
背景情况:
- 人工智能 (AI) 越来越多地用于健康研究.
- 大型语言模型 (LLM) 对布鲁克斯主义信息的有效性未经评估.
研究的目的:
- 评估LLM可读性,准确性和布鲁克斯主义常见问题的一致性.
- 评估聊天GPT-3.5,聊天GPT-4和双子座的性能.
主要方法:
- 使用谷歌趋势确定了顶级的布鲁克西斯主义话题.
- 选择了30个常见问题,对3个LLM进行了两次查询 (T1,T2).
- 测量可读性 (FRE,FKG),准确性 (3点级) 和一致性 (T1与T2).
主要成果:
- 在不同模型中,Flesch阅读易度 (FRE) 没有显著差异.
- 双子座的Flesch-Kincaid等级水平 (FKG) 分数较低.
- 平均准确度:GPT-3.5 (68.33%),GPT-4 (65%),双子座 (55%). 在这些测试中,GPT-4的准确度是:
- 所有模型都显示出实质性的一致性 (GPT-3.5最高在95%).
结论:
- 双子座的反应可能对患者更容易获得.
- 在布鲁克斯主义信息方面,LLM提供了中等准确性和高一致性.
- 人工智能工具是补充,不应该取代专业的牙科指导.


