在正牙科生成AI语言模型的比较分析:基于证据的洞察力困惑,iASK,和ChatGPT 4o迷你迷你
Simarpreet Bhamra1, Ramya Vijeta Jathanna1
1Department of Orthodontics and Dentofacial Orthopedics, Manipal College of Dental Sciences, Manipal Academy of Higher Education, Manipal, India, manipal.edu.
TheScientificWorldJournal
|March 6, 2026
概括
与ChatGPT 4o mini和iASK相比,人工智能语言模型Perplexity在正查询方面显示出更高的科学可靠性. 这种评估对AI在临床环境中至关重要.
科学领域:
- 矯正牙科 矯正牙科是一種矯正牙科.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地使用.
- 评估临床应用LLM的科学可靠性至关重要.
- 牙正对人工智能驱动的信息检索提出了独特的挑战.
研究的目的:
- 为了比较三个LLM的科学可靠性:困惑,iASK和ChatGPT 4o mini.
- 评估这些人工智能模型在应对临床正牙问题的表现.
- 为了确定LLMs是否适合正义牙科信息需求.
主要方法:
- 对每个LLM提出了10个临床正牙问题.
- 答案由两个评价者使用0-10级别独立评分.
- 统计分析包括相关性和可靠性测试 (克朗巴赫的α,威尔科克森的签名等级测试).
主要成果:
- 困惑性获得了最高的平均分数 (7.2),超过了iASK (5.4) 和ChatGPT 4o mini (5.2).
- 在Perplexity与其他两个模型之间观察到显著的性能差异 (p = 0.002).
- 证实了高的相互评估者可靠性 (克朗巴赫的α=0.947;皮尔森的r=0.982).
结论:
- 与iASK和ChatGPT相比,Perplexity在正牙查询方面表现出更高的科学可靠性 4o mini.
- 该研究强调,在临床实施之前,需要对人工智能模型进行严格评估.
- 这些研究结果表明,人工智能在牙矯正方面存在潜在的潜力,等待进一步验证.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.3K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.7K
