视力的得分是多么可靠? 评估用于自动检测系统的人类标签可变性的评估
Konstantina Linardopoulou1, Lorenzo Viora1, George King1
1School of Biodiversity, One Health and Veterinary Medicine, University of Glasgow, Glasgow, UK.
The Journal of dairy research
|March 9, 2026
概括
乳牛的主观视觉的得分是不可靠的,影响机器学习. 减少人类得分变化对于准确的自动的检测至关重要.
科学领域:
- 动物科学动物科学
- 兽医医学 兽医医学 兽医医学
- 机器学习 机器学习
背景情况:
- 视觉移动性评分对于检测乳牛的情况至关重要.
- 目前的主观评分方法不一致,影响机器学习的数据质量.
- 需要可靠的方法来评估和标记牛的流动性.
研究的目的:
- 评估多个评估者的视觉移动性得分的可靠性.
- 评估评分方法 (现场与视频) 和经验水平对标签质量的影响.
- 识别导致机器学习应用程序分数变化的因素.
主要方法:
- 从两个农场收集的数据使用AHDB四分移动度量表和二分化版本.
- 现场和视频评估均由具有不同经验的评估员进行.
- 统计分析,包括加权卡帕和回归,用于评估一致性和影响因素.
主要成果:
- 观察到评估者内部和评估者之间存在很大差异,特别是在正常和略微异常的步态方面.
- 在现场和视频评估之间,得分一致性只是公平的 (加权卡帕≈0.33).
- 视频观看频率增加和动物速度增加对评估者之间的协议产生了负面影响.
结论:
- 主观的视觉移动性评分在创建可靠的机器学习标签方面提出了重大挑战.
- 简化得分提高了协议,但减少了数据的细节性.
- 尽量减少分数变化和提高标签确定性的策略对于改善乳牛自动的检测至关重要.


