化合物分类和从使用自然语言处理对抗氧化能力的文章中考虑与化学描述物的相关性
Yuto Matsumoto1, Hiroaki Gotoh1
1Department of Chemistry and Life Science, Yokohama National University, 79-5 Tokiwadai, Hodogaya-ku, Yokohama 240-8501, Japan.
Journal of chemical information and modeling
|December 20, 2023
概括
这项研究使用自然语言处理来分析抗氧化剂研究,创建像黄类化合物这样的化合物集群. 这种方法将化学描述剂与化合物集群联系起来,从而推进抗氧化能力的估计.
科学领域:
- 化学 化学 化学
- 计算化学的计算化学
- 生物信息学是一种生物信息学.
背景情况:
- 对抗氧化剂的研究越来越多.
- 由于信息整合的挑战,缺乏抗氧化能力的综合估计器.
- 抗氧化机制的复杂性阻碍了简单的相关性发展.
研究的目的:
- 从化学角度开发一种解释抗氧化能力研究中集体知识的模型.
- 利用自然语言处理 (NLP) 来分析关于抗氧化剂的科学文献.
- 建立化学化合物描述符和它们在科学文本中的表述之间的联系.
主要方法:
- 应用Word2Vec,一种自然语言处理技术,分析与抗氧化剂相关的文章.
- 复合名称的表示向量的提取.
- 将复合载体分成10个不同的组.
- 使用内核密度估计和散射图来可视化描述符和集群之间的关系.
主要成果:
- 化合物根据其文本表示方式被组织成10个不同的集群.
- 确定了两个集群主要含有黄类和黄类糖化物.
- 视觉化证实了化合物描述符和它们各自的集群之间的强烈关系.
- 通过NLP文档分析,通过NLP文档分析证明了词向量和复合描述符之间的切实联系.
结论:
- 这项研究开创了与NLP一起使用文档分析进行抗氧化能力研究的先驱.
- 这些发现表明NLP可以有效地解释这个领域的复杂科学知识.
- 开发的方法为理解和估计抗氧化能力提供了一种新的方法.


