科特辩护人:为越狱攻击减轻预防性思维链的占领
Xiaokang Li1, Jin Liu2, Yongqiang Tang3
1Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University, Wuhan, Hubei, China; Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science, Jinan, Shandong, China.
CoT Defender 通过使用思维链分析来阻止有害内容,增强了大型语言模型 (LLM) 对越狱攻击的安全性. 这种方法可以提高安全性,而不会显著影响合法请求的可用性.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 网络安全 网络安全
背景情况:
- 大型语言模型 (LLM) 容易受到越狱攻击,危及它们的安全性,并导致潜在的滥用.
- 当前的防御机制往往无法平衡强大的安全性与保持LLMs的可用性.
研究的目的:
- 介绍CoT Defender,这是一种新的防御策略,可以缓解LLMs的越狱攻击.
- 增强LLM安全性,同时保持模型对良性任务的可用性.
主要方法:
- 在最初生成的代币中,CoT Defender采用了一种思维链 (CoT) 分析,以破坏对抗性输入.
- 一个两阶段的培训框架:第一阶段是对结构化的CoT进行微调,第二阶段使用强化学习来改进.
- 辅助攻击者模型生成提示,可能结构化输出评估 (PSOE) 根据意图和格式忠实性提供奖励.
主要成果:
- 在四个测试的LLM中,平均越狱攻击成功率降低到8.0%以下.
- 保持高可用性,对良性请求的响应率的影响不到7.0%.
- 证明了对六种不同的攻击方法的有效性.
结论:
- CoT Defender 提供了一种有效的解决方案,用于加强 LLM 对越狱攻击的安全性.
- 提出的方法成功地平衡了强大的保护与对模型可用性的最小影响.
- 这项研究为更安全的LLM部署提供了实际的防御机制.
相关概念视频
12:02Collection and Extraction of Occupational Air Samples for Analysis of Fungal DNA
Acid Attack on Concrete
The rate at which hydrogen...
Sulfate Attack on Concrete
Sulfates from sources like soil, groundwater, or industrial effluents...
05:50Measuring Light-Switching Behavior Using an Occupancy and Light Data Logger
Electron Transport Chains
The ETC is comprised of...
Measuring Cerebral Blood Volume in the Auditory Cortex Using Vascular Space Occupancy

