适应性政治调查和GPT-4:通过模拟的用户互动解决冷启动问题
Fynn Bachmann1,2, Daan van der Weijden1,2, Lucien Heitz1,2
1Department of Informatics, University of Zurich, Zurich, Switzerland.
PloS one
|May 22, 2025
概括
大型语言模型 (LLM) 可以生成用于自适应政治调查的合成用户交互数据. 使用此LLM生成数据的预培训模型可以提高调查准确性和候选人推.
科学领域:
- 政治科学 政治科学是指政治学.
- 计算机科学 计算机科学
- 数据科学数据科学数据科学
背景情况:
- 适应式问卷提供了传统调查的数字替代方案,特别是在政治学领域.
- 一个关键的限制是需要先前存在的用户交互数据来训练问题选择模型,这往往是不可用的.
- 大型语言模型 (LLM) 为生成合成训练数据提供了一个潜在的解决方案.
研究的目的:
- 调查LLM是否可以准确地生成用于自适应调查的合成用户交互数据.
- 探索这种合成数据在政治学调查中预训练统计模型的实用性.
- 评估LLM生成数据对自适应问卷表现的影响.
主要方法:
- 使用瑞士投票咨询应用程序 (VAA) 智能投票数据进行评估.
- 将LLM生成的合成数据分布与真实用户数据进行比较.
- 通过随机初始化与使用合成数据进行预训练来评估适应性问卷表现.
- 结果与具有完美的先验知识的"预言"问卷进行了比较.
主要成果:
- 一个现成的LLM (GPT-4) 准确地模拟了来自各种瑞士政党观点的Smartvote调查问卷的答案.
- 在训练之前,使用合成数据的自适应问卷模型显著减少了响应预测错误.
- 通过使用合成训练数据,VAA中的候选人推准确度明显增加.
结论:
- 劳动力学问卷显示出产生适应性问卷的宝贵培训数据的巨大潜力.
- 这种方法可以增强LLM相关领域的数据收集过程,如政治调查.
- 通过LLM生成的合成数据可以提高自适应调查系统的效率和准确性.


