联合教育部:扩大统一多式模式的LLM与专家混合
概括
Uni-MoE引入了一个统一的专家组合 (MoE) 架构,用于多式大型语言模型 (MLLMs). 这种方法有效地处理各种数据类型,减少复杂数据集中的计算成本和性能偏差.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 自然语言处理自然语言处理.
背景情况:
- 多模大型语言模型 (MLLMs) 的进步需要可扩展的解决方案,但往往面临高计算成本.
- 扩展模型的现有专家混合 (MoE) 架构在处理的专家和模式数量上有局限性.
研究的目的:
- 开发一个开创性的统一多模大型语言模型 (MLLM),使用专家混合 (MoE) 架构,命名为Uni-MoE.
- 为了能够在单一的MLLM框架内高效地处理广泛的模式.
主要方法:
- 开发了Uni-MoE,采用模式特定的编码器与连接器,用于统一的多式联网表示.
- 通过数据和模型并行性实现了稀疏的MoE架构,以便通过数据和模型并行性进行高效的培训和推断.
- 引入了一种渐进式的培训策略,包括跨模式的调整,模式特定的专家培训和低级适应 (LoRA) 调整.
主要成果:
- 在处理混合多式联运数据集时,Uni-MoE证明了业绩偏差的显著减少.
- 该模型展示了改进的多专家协作和增强的概括能力.
- 实验结果证实了拟议的培训战略的有效性.
结论:
- Uni-MoE 提供了一种有效且可扩展的解决方案,用于LLMs的统一多式联络处理.
- 拟议的架构和培训方法解决了MLLM中的计算挑战和性能偏差.
- 这项工作为更高效和多用途的多式联运人工智能系统铺平了道路.


