数据驱动的方法考虑数据集的不平衡和光催化剂探索的实验条件
Wataru Takahara1, Ryuto Baba1, Yosuke Harashima1,2
1Division of Materials Science, Nara Institute of Science and Technology, Ikoma-shi, Nara-ken 630-0192, Japan.
ACS omega
|April 28, 2025
概括
本研究引入了一种两阶段的机器学习模型,以解决材料开发中的不平衡数据,提高新型光催化剂的预测准确度,而无需数据稀释.
科学领域:
- 材料科学 材料科学 材料科学
- 计算化学的计算化学
- 机器学习 机器学习
背景情况:
- 材料数据集中的数据不平衡阻碍了准确的回归模型构建,特别是对于像光催化剂这样的无机功能材料.
- 开发新型光催化剂需要先进的数据驱动方法来克服数据限制.
研究的目的:
- 提出一种新的两阶段机器学习模型,用于处理材料开发中的不平衡数据集.
- 提高开发新光催化材料的效率,尽管某些地区的数据稀缺.
- 在光催化剂探索中开发一个最佳实验条件的搜索方案.
主要方法:
- 一个两阶段的机器学习模型,包括用于定量预测的回归模型和用于可靠性评估的分类模型.
- 使用了开放访问的材料项目数据集和机密的内部金属硫化物光催化剂数据集.
- 开发了与两阶段模型集成的实验条件变量搜索方案.
主要成果:
- 拟议的两阶段机器学习模型与一阶段模型相比,显示出更好的预测准确性.
- 该模型有效地处理不平衡的数据集,而不需要数据稀释.
- 综合搜索方案有助于确定光催化剂开发的最佳实验变量.
结论:
- 两阶段机器学习模型为数据驱动的材料开发提供了强大的解决方案,使用不平衡的数据集.
- 这种方法有助于有效地发现新型光催化材料.
- 该方法为优化材料研究中的实验条件提供了一个框架.


