针对台湾网络和网络安全的本地化大型语言模型 TCNNet 9B
Jiun-Yi Yang1,2, Chia-Chun Wu3
1Department of AI & Data, Hi5 Technology Incorporation, Taipei, Taiwan.
Scientific reports
|March 21, 2025
概括
作为一种专门的传统中文语言模型,TCNNet-9B显著改善了台湾的网络行业任务. 这个特定领域的模型显示了更高的准确性和相关性,表现优于基线模型.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 计算机科学 计算机科学
背景情况:
- 大型语言模型 (LLM) 往往缺乏特定领域的知识和专业行业的本地化.
- 台湾的网络行业具有独特的需求,一般目的的LLM不能完全满足.
研究的目的:
- 为台湾网络部门量身定制的专用传统中文语言模型TCNNet-9B进行介绍.
- 与基线模型相比,评估TCNNet-9B的性能和实际有效性.
主要方法:
- 在Yi-1.5-9B架构的基础上开发了TCNNet-9B.
- 通过使用精心策划的网络信息和本地化法规数据集进行了广泛的预培训和教学微调.
- 通过使用英语,传统中文和简体中文的自定义基准来评估性能.
主要成果:
- TCNNet-9B在问答准确度方面实现了2.35倍的改进.
- 在领域专业知识理解方面表现出37.6%的增长.
- 在产品推相关性方面显示了29.5%的增强.
- 成功集成到一个智能销售顾问系统中.
结论:
- 特定领域的适应和本地化对于提高非英语和专业环境中的LLM绩效至关重要.
- TCNNet-9B为开发垂直特定语言模型提供了有价值的参考.


