猫的协议 聊天机器人和专家评级者之间的猫评分
Sze T Ngai1, Syed S U H Bukhari2,3, Santiago Alonso Sousa2
1Jockey Club College of Veterinary Medicine and Life Sciences, City University of Hong Kong, Hong Kong SAR, China.
Scientific reports
|December 9, 2025
概括
大型语言模型 (LLM) 在使用猫笑尺度 (FGS) 评估猫疼痛方面表现不佳. 大多数聊天机器人低估了疼痛评分,可能会损害猫类止痛,导致治疗不足.
科学领域:
- 兽医医学 兽医医学 兽医医学
- 动物健康中的人工智能
- 动物福利评估 动物福利评估
背景情况:
- 准确的急性疼痛评估对于猫的有效止痛至关重要.
- 大型语言模型 (LLM) 尚未评估它们在猫疼痛评分中的性能.
- 猫微笑尺度 (FGS) 是一种验证的工具,用于评估猫的疼痛.
研究的目的:
- 为了评估四个聊天机器人和一名专家兽医之间的猫咪笑容量表 (FGS) 评分的协议.
- 评估聊天机器人疼痛评分中的偏见和同意限度 (LoA).
- 为了确定在两个月后重新测试时偏差是否减少.
主要方法:
- 五十个猫的面部图像被打分两次,两个月的间隔,由ChatGPT,双子座,克劳德AI和困惑使用FGS.
- 布兰德-阿尔特曼方法被用来分析偏差和LoA.
- 评分包括耳朵位置,轨道紧张,嘴巴紧张,胡须变化和头部位置.
主要成果:
- 所有聊天机器人都表现出积极的偏见,表明低估了FGS得分.
- 克劳德AI显示了可接受的偏差,但其LoA跨越了FGS止痛门.
- 聊天GPT,双子座和困惑表现出不可接受的偏见,LoA跨越了部分或所有评估的门.
结论:
- 大多数聊天机器人表现出与专家评分的差异一致,可能会危及猫类止痛.
- 通过LLM进行不一致的疼痛评分可能导致猫的疼痛过度治疗或治疗不足.
- 需要进一步的研究来改善兽医疼痛评估中的AI性能.


