基于专家审查的AI口评估和干预计划的内容有效性:跨年龄组和语言版本的比较分析
Ayşe Nur Koçak1, Melis Buse Arslan2
1İstanbul Atlas University, Üsküdar University, Speech and Language Deparment, İstanbul, Turkey.
Journal of fluency disorders
|December 7, 2025
概括
人工智能 (AI) 可以产生临床相关的口吃程序,但专家审查对于完善文化特定内容至关重要. 人类验证确保人工智能辅助工具有效支持多语言临床开发.
科学领域:
- 语音语言病理学 语言病理学
- 医疗保健中的人工智能
- 临床语言学 临床语言学
背景情况:
- 像GPT-4这样的AI工具对生成临床材料非常有希望.
- 针对流利性障碍的多语言内容创作需要仔细考虑文化细微差别.
研究的目的:
- 在土耳其语和英语中评估人工智能生成的口吃程序 (GPT-4) 的内容有效性和评级者之间的可靠性.
- 评估语言和文化差异对AI产生的内容的专家评估的影响.
主要方法:
- 12个AI产生的口吃程序 (6个土耳其语,6个英语) 被12名流利障碍专家审查.
- 专家使用了5点的利克尔特级别;可靠性是使用克伦巴赫的α和类内相关系数 (ICC) 进行评估的.
主要成果:
- 大多数人工智能产生的项目被评为非常合适 (M=4.6-4.9).
- 总体而言,评级机构间的可靠性很差 (ICC=0.45),但单一评级机构的可靠性更高 (ICC=0.65).
- 英语版本更详细;土耳其版本需要对情感/上下文元素进行文化调整.
结论:
- GPT-4可以创建临床相关的口吃材料,但专家人类验证对于改进至关重要.
- 在仔细监督下,人工智能辅助工具可以集成到多语言临床内容开发中.
- 解决情感和文化特异性的因素是有效的AI驱动的临床工具的关键.


