广泛的数据,广泛的模型:在学术论文和新闻中通过无监督机器学习调查LLM周围的讨论主题
Hae Sun Jung1, Haein Lee1,2, Young Seok Woo1
1Department of Applied Artificial Intelligence, Sungkyunkwan University, Seoul, Korea.
PloS one
|May 31, 2024
概括
这项研究评估了大型语言模型 (LLM) 的话题建模,发现BERTopic在分析新闻和研究数据方面优越. 洞察力指导未来的LLM开发和企业应用.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 数据科学数据科学数据科学
背景情况:
- 大型语言模型 (LLM) 正在迅速发展,需要有效的方法来分析他们的话语.
- 了解LLM研究和应用的专题格局对于战略发展至关重要.
- 现有的主题建模技术需要用LLM生成的或LLM专注的数据对其有效性进行评估.
研究的目的:
- 为了全面探索和比较用于分析大型语言模型 (LLM) 数据的主题建模方法.
- 根据多样性和连贯性指标评估各种主题建模方法的性能.
- 区分关于LLMs的新闻文章和研究论文之间的专题重点.
主要方法:
- 来自Web of Science和LexisNexis (2020年6月至2023年12月) 的数据,使用关键词如"大型语言模型"",LLM"和"ChatGPT".
- 对话题建模算法的比较分析:潜伏狄里克莱特分配 (LDA),非负矩阵因子化 (NMF),组合主题模型 (CTM) 和BERTopic.
- 使用跨不同数据源的多样性和一致性指标进行绩效评估.
主要成果:
- 与LDA,NMF和CTM相比,BERTopic在主题多样性和连贯性方面表现优越.
- 新闻文章显示了平衡的主题报道,强调在专业领域的LLM应用.
- 研究论文更多地集中在LLMs的技术方面和核心技术上.
结论:
- BERTopic是一种高效的方法,用于分析来自不同来源的LLM相关话语.
- 大众媒体和学术研究LLM之间存在着不同的主题模式.
- 这些发现为导航LLM开发和部署的未来轨迹和挑战提供了宝贵的见解.
更多相关视频
08:05Measuring Statistical Learning Across Modalities and Domains in School-Aged Children Via an Online Platform and Neuroimaging Techniques
Published on: June 30, 2020
7.5K
06:48Lexical Decision Task for Studying Written Word Recognition in Adults with and without Dementia or Mild Cognitive Impairment
Published on: June 25, 2019
9.2K
