加强社交媒体上的刺言论检测:使用LLM和BERT进行的一项综合性研究,对SARC进行多方面的关注
Lihong Zhang1, Muhammad Faseeh2, Syed Shehryar Ali Naqvi3
1School of Foreign Studies, Hunan First Normal University, Changsha, Hunan, China.
PloS one
|November 14, 2025
概括
这项研究通过在社交媒体数据上使用BERT等变压器模型来增强刺言论的检测. 基于BERT的方法取得了最先进的结果,改善了自然语言处理能力.
科学领域:
- 自然语言处理自然语言处理.
- 人工智能的人工智能
- 计算语言学 计算语言学
背景情况:
- 在自然语言处理 (NLP) 中检测刺是具有挑战性的,因为社交媒体中的细微的上下文线索.
- 基于变压器的模型为改进刺言论检测提供了潜在的潜力.
- 自我注释的Reddit Corpus (SARC) 为此任务提供了一个大型数据集.
研究的目的:
- 利用变压器模型 (BERT,GPT-3,Claude-2,Llama-2) 进行增强的刺言论检测.
- 调查多头注意力机制对模型性能的影响.
- 在SARC数据集上比较微调变压器模型的有效性.
主要方法:
- 使用的变压器模型包括BERT,GPT-3,Claude-2和Llama-2.
- 采用多头注意力机制来捕捉上下文关系.
- 微调的BERT,GPT-3和Llama-2模型用于对SARC数据集进行比较分析.
主要成果:
- 精心调整的基于BERT的模型实现了最先进的性能.
- 获得的精度,回忆,F1得分,准确度分别为0.918,0.917,0.917和0.917.
- 通过统计验证和错误分析,证明了对其他评估模型的优越性.
结论:
- 精细调节的BERT与多头注意力对于刺言论的检测非常有效.
- 强调在NLP任务中微调和注意力机制的重要性.
- 提出的方法提供了一个强大的解决方案,用于识别社交媒体文本中的刺言论.

