利用大型语言模型进行传染病监测-使用网络服务从自我报告的推特上监测COVID-19模式:内容分析
Jiacheng Xie1,2, Ziyang Zhang1,2, Shuai Zeng1,2
1Department of Electrical Engineering and Computer Science, University of Missouri, Columbia, MO, United States.
Journal of medical Internet research
|February 20, 2025
概括
社交媒体数据显示了COVID-19的趋势,包括新的症状和更快的恢复时间. 这种分析有助于追踪病毒.
科学领域:
- 流行病学 流行病学
- 公共卫生 公共卫生
- 计算社会科学 计算社会科学
背景情况:
- 新的SARS-CoV-2变种的出现,再感染和COVID-19后的状况带来了持续的公共卫生挑战.
- 传统的病例追踪方法不足,原因是轻度病例和自我评估病例的报告不足.
- 社交媒体为监测疾病趋势提供了一个有价值的,尽管有偏见的来源.
研究的目的:
- 创建一个公开可访问的COVID-19相关推文数据库.
- 提取和分析有关症状,康复,再感染和长期影响的自我报告数据.
- 开发一个可视化网站,实时跟踪COVID-19趋势.
主要方法:
- 从2020年1月到2024年4月收集了730万条与COVID-19相关的推文.
- 使用人类注释器和大型语言模型来识别262,278个自我报告的病例.
- 应用希伯特转换用于感染曲线的预测建模,并在Covlab网站上提出了研究结果.
主要成果:
- 模型预测率先于官方报告7.63天.
- 识别了非CDC列出的症状,如昏迷和幻觉.
- 记录了高的再感染率 (第二次再感染的7.49%,第三次再感染的1.37%).
- 观察到平均恢复时间从~30天 (2020) 到~12天 (2023) 显著减少.
结论:
- 自我报告的社交媒体数据是临床数据的关键补充,用于流行后的监测.
- 开发的网络平台有助于跟踪COVID-19,识别新型症状,并监测长期影响.
- 为公共卫生决策和公众意识提供及时的见解.


