相关实验视频
Updated: Jul 2, 2026

10:05
High-throughput Detection Method for Influenza Virus
Published on: February 4, 2012
26.3K
在加拿大萨斯喀彻温省使用社交媒体文本数据,比较预训练的基于变压器的流感和COVID-19检测模型
Yuan Tian1, Wenjing Zhang1, Lujie Duan1
1Department of Computer Science, University of Saskatchewan, Saskatoon, SK, Canada.
Frontiers in digital health
|July 14, 2023
概括
社交媒体数据可以增强流感和COVID-19监测. 像CT-BERT和BERTweet这样的域特定语言模型在检测来自Twitter数据的感染方面表现强.
科学领域:
- 计算流行病学计算流行病学
- 自然语言处理自然语言处理.
- 公共卫生监督 公共卫生监督
背景情况:
- 社交媒体数据为追踪流感和COVID-19爆发的传统方法提供了有价值的补充.
- 通过Twitter等平台监测公共卫生趋势,可以为干预和控制策略提供信息.
研究的目的:
- 评估推特用户在多大程度上披露健康经验,表明流感或COVID-19感染.
- 训练和评估来自变压器 (BERT) 的双向编码器表示及其变体,用于从Twitter数据中检测流感和COVID-19.
主要方法:
- 从加拿大萨斯喀彻温省的英语推特 (2016-2022) 构建流感和COVID-19数据集,使用关键字过.
- 对可信的流感或有症状的COVID-19病例进行注释的推文,并评估了多个基于变压器的语言模型的性能.
- 研究过量采样和不足采样技术对分类性能的影响,特别是对不平衡的数据集.
主要成果:
- COVID-19数据集包含7.7%的阳性病例,而流感数据集有17.5%的阳性病例.
- COVID-Twitter-BERT (CT-BERT) 在COVID-19数据集上实现了最高的性能 (94.6%的准确性).
- BERTweet模型在流感数据集上表现最好,数据平衡技术没有改善模型性能.
结论:
- 特定领域的语言模型显著改善了社交媒体上流感和COVID-19相关健康体验的分类.
- 这些模型有可能补充实时疾病监测系统.

