通过混合专家和3D模拟内存计算,高效地扩展大型语言模型
Julian Büchel1, Athanasios Vasilopoulos2, William Andrew Simon2
1IBM Research Europe, Rüschlikon, Switzerland. jub@zurich.ibm.com.
Nature computational science
|January 8, 2025
概括
大型语言模型 (LLM) 面临可扩展性问题. 在3D非挥发性内存 (NVM) 模拟内存计算 (AIMC) 硬件上部署专家组合 (MoEs) 可以降低LLM推断成本和能源消耗.
科学领域:
- 人工智能的人工智能
- 计算机工程 计算机工程
- 材料科学 材料科学 材料科学
背景情况:
- 大型语言模型 (LLM) 显示出显著的生成能力,但由于参数数量大,因此面临可扩展性挑战.
- 模型尺寸的增加加剧了传统的LLM架构中的高内存足迹,延迟和能源消耗等问题.
- 传统的·诺伊曼架构在大型模型中存在参数获取瓶.
研究的目的:
- 调查基于3D非挥发性内存 (NVM) 的模拟内存计算 (AIMC) 硬件上的专家 (MoE) 网络混合的部署.
- 解决与部署大型语言模型相关的可扩展性和成本挑战.
- 评估MoE架构是否适合新兴的3D AIMC硬件.
主要方法:
- 在抽象的3D AIMC系统上模拟了MoE网络的部署.
- 在AIMC硬件的交叉条数组配置中使用堆叠的NVM设备.
- 将MoE架构的性能与3D AIMC硬件上的传统密集模型架构进行比较.
主要成果:
- 由于其条件计算,MoE网络本质上更适合基于3D NVM的AIMC硬件,而不是密集模型.
- 拟议的硬件-软件联合设计有效地克服了参数检索瓶.
- 证明了LLMs的推断成本和能源消耗的大幅降低.
结论:
- 专家组合 (MoEs) 与基于3D NVM的模拟内存计算 (AIMC) 结合,为高效的LLM部署提供了可行的解决方案.
- 这种方法显著提高了最先进的法学士的可访问性和能源效率.
- 强调了MoE架构和新型硬件对未来AI进步的潜力.


