评估用于新生儿诊断推理的生成性AI聊天机器人:比较一致性和诊断可接受性分析
Gaurav Gupta1, Somashekhar Nimbalkar2, Rajesh Kumar3
1Department of Pediatrics, All India Institute of Medical Sciences, Guwahati, Assam, India.
Indian journal of pediatrics
|January 13, 2026
概括
人工智能 (AI) 聊天机器人在产生新生儿病例的差异诊断 (DD) 中没有显著差异. 虽然一致性低于80%,但几种AI模型实现了80-90%的诊断可接受性,因此需要谨慎的整合.
科学领域:
- 新生儿科学 新生儿科学
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 人工智能 (AI) 聊天机器人越来越多地用于医疗保健.
- 评估他们在新生儿科等专业领域的诊断能力至关重要.
研究的目的:
- 将人工智能聊天机器人产生的差异诊断 (DD) 与专家新生儿学家的一致性和可接受性进行比较.
- 在新生儿学背景下评估七种不同的AI聊天机器人的性能.
主要方法:
- 使用了13个具有专家定义的DD的新生儿病例.
- 七个人工智能聊天机器人被查询诊断和DDS.
- 新生儿科医生评估了聊天机器人响应的一致性和可接受性.
主要成果:
- 在七个AI聊天机器人之间,在一致性或诊断可接受性得分方面没有发现统计学上显著的差异.
- 没有一个聊天机器人实现了目标80%的一致性得分.
- 聊天GPT,克劳德和格罗克的诊断可接受度达到了90%左右,而其他诊断可接受度达到了80%.
结论:
- 人工智能聊天机器人在生成新生儿学DDS方面表现相似.
- 虽然一致性需要改进,但诊断的可接受性是有希望的.
- 建议谨慎地将AI聊天机器人整合到临床实践中.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
11:14A Novel Experimental and Analytical Approach to the Multimodal Neural Decoding of Intent During Social Interaction in Freely-behaving Human Infants
Published on: October 4, 2015
11.4K
