在印度使用专门的大型语言模型进行月经健康教育:月经的发展和评估研究LLaMA
Prottay Kumar Adhikary1, Isha Motiyani1, Gayatri Oke1
1Department of Electrical Engineering, Indian Institute of Technology Delhi, Room: 3B-7 (Block III 3rd Floor), Hauz Khas, New Delhi, 110016, India, 91 26591076 ext 011.
Journal of medical Internet research
|July 16, 2025
概括
MenstLLaMA是一个专门的AI模型,通过提供准确,文化敏感的信息,显著改善了印度的月经健康教育. 它在用户满意度和专家评价方面表现优于一般的大型语言模型 (LLM).
科学领域:
- 医疗保健中的人工智能
- 数字健康教育 数字健康教育
- 自然语言处理自然语言处理.
背景情况:
- 包括印度在内的低收入和中等收入国家的月经健康教育 (MHE) 面临着贫困,耻辱和不平等等挑战.
- 一般用途的大型语言模型 (LLM) 往往缺乏对MHE的准确性和文化敏感性.
- 一个专门的LLM,MenstLLaMA,被开发来解决这些限制的印度背景.
研究的目的:
- 开发和评估MenstLLaMA,一个专门的LLM准确和文化敏感的MHE.
- 将MenstLLaMA的有效性与现有的通用LLMs进行比较.
主要方法:
- 精心策划的 MENST 数据集 (23,820 个问答对) 与人口和文化元数据.
- 微调的Meta-LLaMA-3-8B-Instruct使用参数有效的技术.
- 多层次的评估:NLP指标 (BLEU,BERTScore),专家评价,医务人员互动 (ISHA聊天机器人) 和用户研究 (N=200).
主要成果:
- 在BLEU (0.059) 和BERTScore (0.911) 中,MenstLLaMA获得了最高分,超过了GPT-4o和Claude-3.
- 临床专家更喜欢MenstLLaMA的文化敏感反应.
- 用户满意度的评分很高:可理解性 (4.7/5),相关性 (4.3/5),正确性 (4.1/5),以及上下文敏感性 (3.9/5).
结论:
- 与一般法学士相比,MenstLLaMA对MHE的准确性,同理心和用户满意度都更高.
- 它提供了一个可扩展的解决方案,以弥合不同人口中的MHE差距.
- 未来的工作包括扩大人口代表性和整合多式联络互动.


