相关实验视频
Updated: May 11, 2025

09:26
Quantification of Orofacial Phenotypes in Xenopus
Published on: November 6, 2014
9.7K
深度搜索与GPT对比:对大型语言模型聊天机器人的评估 聊天机器人对 Orofacial 裂的反应
Hongru Zhou1, Zhiyan Wang1, Rongsheng Wang2
1Department of Cleft Lip and Palate, Plastic Surgery Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College, Beijing.
The Journal of craniofacial surgery
|April 17, 2025
概括
大型语言模型 (LLM) 显示出患者咨询的前景. 虽然可读性相似,但Deepseek-R1在与GPT o1-preview相比,在 orofacial裂方面提供了更高的准确性和可靠性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 自然语言处理 (NLP) 的进步引入了大型语言模型 (LLM) 作为患者咨询的潜在工具.
- 在临床决策支持和患者互动方面,LLM的实用性越来越多.
研究的目的:
- 调查可推理的LLM对 orofacial裂的诊断和治疗建议能力.
- 为了比较两个LLM的性能,Deepseek-R1和GPT o1-预览,在提供医疗信息的 orofacial裂.
主要方法:
- 一项横截面的比较研究使用了从谷歌趋势和专家输入中获得的20个问题.
- 使用弗莱什-金凯德阅读易度 (FRES) 和等级水平 (FKGL) 评估可读性.
- 医生对4点利克特级别的评估评估了准确性,清晰性,相关性和可信度.
主要成果:
- 在模型之间没有观察到FKGL (P = 0.064) 或FRES (P = 0.56) 的统计学上显著差异.
- 深度搜索-R1在准确性,清晰性,相关性和可信度方面获得了医生评级的显著提高 (P = 0.041).
- 在特定的临床环境中,GPT o1预览显示了显著的同理心.
结论:
- 在 orofacial 裂中,LLM 在临床咨询应用中表现出互补的优势.
- 在提供可靠信息方面,Deepseek-R1显示了优势,而GPT o1-preview则提供了同理心.
- 未来的研究应该专注于将这些优势整合到医疗特定的LLM中,以加强患者建议.

