走向使用半监督学习的自动化食谱类型分类.
Nazmus Sakib1, G M Shahariar2, Md Mohsinul Kabir1
1SSL Lab, Dept. of CSE, Islamic University of Technology, Dhaka, Bangladesh.
PloS one
|January 28, 2025
概括
一个新的200万种食谱数据集,即分类,原型和注释200万种扩展 (3A2M+) 数据集,有助于配方分类和命名实体识别 (NER). 这一数据集在类型分类中实现了98.6%的准确性,突出了食谱标题的重要性.
科学领域:
- 自然语言处理自然语言处理.
- 机器学习 机器学习
- 计算语言学 计算语言学
背景情况:
- 由于标签数据不足,将在线食谱分类为类型很困难.
- 现有的数据集缺乏用于配方分析的全面注释.
研究的目的:
- 介绍各种,原型和注释的200万扩展 (3A2M+) 食谱数据集.
- 为配方分类,命名实体识别 (NER) 和生成任务提供一个强大的数据集.
- 通过扩展配方指令的实体列表来增强NER功能.
主要方法:
- 开发了3A2M+数据集,包含超过200万个标记的食谱.
- 利用两个NER提取工具来扩展食谱指令的实体识别.
- 应用传统的机器学习,深度学习和预训练的语言模型进行类型分类.
主要成果:
- 在将食谱分为九种类型时,获得了98.6%的整体准确性.
- 证明了3A2M+数据集在各种NLP任务中的有效性.
- 识别了食谱标题作为类型分类中最重要的特征.
结论:
- 3A2M+数据集为与配方相关的NLP挑战提供了全面的解决方案.
- 拟议的NER扩展管道改善了配方说明的分析.
- 配方标题分析对于准确的类型分类至关重要.


