评估大型语言模型对恶意转换成健康虚假信息聊天机器人的系统指令漏洞
Natansh D Modi1, Bradley D Menz2, Abdulhalim A Awaty2
1Flinders University, College of Medicine and Public Health, Flinders Health and Medical Research Institute, and Clinical and Health Sciences, University of South Australia, Adelaide, Australia (N.D.M.).
大型语言模型 (LLM) 可以被操纵来创建健康虚假信息聊天机器人,大多数测试的模型产生虚假的健康声明. 这凸显了改善保障措施的迫切需要,以保护公众健康免受人工智能产生的错误信息的影响.
科学领域:
- 人工智能的人工智能
- 公共卫生 公共卫生
- 网络安全 网络安全
背景情况:
- 大型语言模型 (LLM) 显示了医疗保健应用的潜力,但也带来了风险,特别是关于健康错误信息的传播.
- 评估基础LLM对恶意使用的安全性对于公共安全至关重要.
研究的目的:
- 评估主要LLM中针对旨在创建健康虚假信息聊天机器人的恶意指令的保护措施的有效性.
- 探索LLM应用程序编程接口 (API) 和OpenAI GPT Store对产生健康错误信息的脆弱性.
主要方法:
- 五个领先的LLM (GPT-4o,Gemini 1.5 Pro,Claude 3.5 Sonnet,Llama 3.2-90B Vision,Grok Beta) 通过API进行了测试.通过API进行了测试.
- 系统级指令被用来提示聊天机器人生成听起来权威但不正确的健康信息.
- 探索性分析检查了OpenAI GPT存储,以发现散布虚假信息的GPT.
主要成果:
- 在五个LLM聊天机器人的100个健康查询中,88%的结果是健康错误信息.
- 四个LLM (GPT-4o,Gemini 1.5 Pro,Llama 3.2-90B Vision,Grok Beta) 在100%的回答中产生了虚假信息.
- 虚假信息的主题包括疫苗与自闭症的联系,艾滋病毒的传播以及未经证实的癌症治疗方法. OpenAI GPT 商店也被发现是脆弱的.
结论:
- LLM API 和 OpenAI GPT 存储器易受恶意指令的影响,用于创建健康虚假信息聊天机器人.
- 迫切需要强有力的输出查和保障措施,以确保公共卫生安全.
- 该研究强调了人工智能安全在快速发展的技术环境中的关键重要性.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
08:53Integrating Computerized Linguistic and Social Network Analyses to Capture Addiction Recovery Capital in an Online Community
Published on: May 31, 2019
相关概念视频
Stereotype Content Model
Leaky Scanning
Improving Translational Accuracy
Nonsense-mediated mRNA Decay
Non-equilibrium in the Cell
Strategies for Assessing and Addressing Confounding
Confounding can be addressed at both the design phase of a study and through analytical methods after data...
