聊天GPT不复制人类的道德判断:检查比相关性之外的指标的重要性,以评估协议协议
Matthew Grizzard1, Rebecca Frazer2, Andrew Luttrell3
1School of Communication, The Ohio State University, Columbus, Ohio, USA. grizzard.6@osu.edu.
大型语言模型 (LLM) 显示出强烈的相关性,但在预测人类道德判断时会有系统的错误. 与人类相比,LLM的变化性较小,评级更极端,表明它们还不是替代品.
科学领域:
- 人工智能的人工智能
- 认知科学 认知科学
- 伦理学 伦理学 伦理学
背景情况:
- 生成型人工智能,特别是大型语言模型 (LLM),越来越多地被提出作为研究中人类参与者的替代品.
- 这一说法在道德判断任务中尤为突出,LLM输出与人类反应之间的相关性接近完美.
- 然而,这些说法的有效性需要严格审查,而不仅仅是简单的相关性.
研究的目的:
- 调查大型语言模型 (LLM) 是否可以准确地替代人类参与道德判断任务.
- 识别和量化LLM预测和实际人类道德判断之间的系统差异.
- 评估与人类相比,LLM提供的道德评级的变化和范围.
主要方法:
- 进行了一项预先注册的研究,涉及两个LLM (text-davinci-003和GPT-4o) 预测人类的道德判断.
- 对60个道德场景的LLM预测与来自大量人群的评分进行了比较 (N=940).
- 分析了差异得分和效果大小,以量化系统错误和可变性.
主要成果:
- 尽管相关性很高 (r ≈ 1.00),但与人类判断相比,LLM表现出大量的系统错误.
- 在道德/中性情景中,LLM提供了更极端的道德评分,在不道德情景中提供了更极端的不道德评分.
- 在约87%的场景中,ChatGPT评级与人类平均值有显著差异,效果大小中等,并且显示限制值聚类,缺乏人类可变性.
结论:
- 包括GPT-4o等先进模型在内的LLM并不能准确地替代人类参与道德判断任务.
- 对极端和较少变化的反应的系统偏见突出了LLM道德推理的局限性.
- 更广泛的评估标准对于将LLM预测与人类对复杂的认知任务 (如道德推理) 的反应进行比较至关重要.
更多相关视频
07:34Perceptual and Category Processing of the Uncanny Valley Hypothesis' Dimension of Human Likeness: Some Methodological Issues
Published on: June 3, 2013
09:38Generalized Psychophysiological Interaction PPI Analysis of Memory Related Connectivity in Individuals at Genetic Risk for Alzheimer's Disease
Published on: November 14, 2017
相关概念视频
Detection of Gross Error: The Q Test
Quantifying and Rejecting Outliers: The Grubbs Test
Regression Toward the Mean
Statistical Analysis: Overview
One of the most commonly used statistical quantifiers is the mean, which is the ratio between the sum of the numerical values of all results and the...
Reliability and Validity
Fundamental Attribution Error
