与你的数据交谈:在心理学研究中引入文本嵌入相似性分析 (TESA)
Juul Vossen1, Evy Kuijpers2, Joeri Hofmans1
1Department of Work and Organizational Psychology, Vrije Universiteit Brussel, Pleinlaan 2, 1050, Brussels, Belgium.
本研究介绍了文本嵌入相似性分析 (TESA),这是一种使用检索增强生成 (RAG) 和大型语言模型 (LLM) 进行定性研究假设测试的新方法.
科学领域:
- 计算语言学 计算语言学
- 定性数据分析 数据分析.
- 自然语言处理自然语言处理.
背景情况:
- 定性研究是有价值的,但由于文本数据的统计建模的局限性,与假设测试作斗争.
- 传统的文本量化方法是劳动密集型的,容易产生偏见,并忽视语义细微差别.
- 现有的新方法往往需要大量的数据,并且主要是诱导性的.
研究的目的:
- 引入一种基于搜索增强生成 (RAG) 的新方法,即文本嵌入相似性分析 (TESA),用于基于假设的文本数据分析.
- 为了使研究人员能够为定性数据制定基于假设的和开放式的问题.
- 克服用文本数据测试假设的传统方法的局限性.
主要方法:
- TESA将假设转化为人口/样本和变量搜索术语.
- 预先训练好的大型语言模型 (LLM) 提取搜索术语和文本数据的语义嵌入.
- 代数相似性用于匹配嵌入,通过相似性分数分布分析进行假设测试.
主要成果:
- 提议的TESA方法通过分析相似度得分的对齐来促进假设测试.
- 它允许在文本数据中对特定群体内的变量之间的关系进行定量评估.
- 展示了RAG和LLM用于结构化定性数据分析的新型应用.
结论:
- TESA为定性研究中的假设测试提供了一种强大,可扩展和不太偏见的方法.
- 这种方法将语义理解与文本分析的统计严谨性相结合.
- TESA使研究人员能够有效地从定性文本数据中获得定量见解.
更多相关视频
08:17A Semantic Priming Event-related Potential ERP Task to Study Lexico-semantic and Visuo-semantic Processing in Autism Spectrum Disorder
Published on: April 12, 2018
06:48Lexical Decision Task for Studying Written Word Recognition in Adults with and without Dementia or Mild Cognitive Impairment
Published on: June 25, 2019
相关概念视频
Empathy
Causes of Similarity-Dissimilarity Effect
Stereotype Content Model
Factors Influencing Attraction III: Similarity
Stereotypes, Prejudice, and Discrimination
Automatic Processing and Automatic Social Behavior
