利用顺序测试来评估对高维度生物数据集应用的积极无标记学习的信心
Shiwei Xu1, Margaret E Ackerman2,3,4
1Quantitative Biomedical Sciences Program, Dartmouth College, Hanover, NH, USA.
BMC bioinformatics
|June 19, 2024
概括
积极未标记 (PU) 学习模型可以使用已知的积极 (KP) 样本进行验证. 变换测试为评估PU模型稳定性建立了基线,而不需要基准真实标签.
科学领域:
- 机器学习 机器学习
- 数据科学数据科学数据科学
- 计算生物学 计算生物学
背景情况:
- 传统的监督机器学习需要完全标记的数据.
- 积极无标记 (PU) 学习解决了具有有限或没有负面示例的场景.
- 验证PU模型是具有挑战性的,因为没有基准真相负面标签.
研究的目的:
- 开发和评估一种用于验证PU学习模型的新方法.
- 评估已知阳性 (KP) 样本的有用性,以表明模型质量.
- 为了建立一个强大的评估框架,PU学习没有地面真相标签.
主要方法:
- 结合了多个PU学习策略与排列测试.
- 利用多变量合成和现实世界的高维数据集.
- 将模型性能与换的标签进行比较,以评估可靠性.
主要成果:
- 证明了拟议的管道适用于评估模型稳定性的适用性.
- 展示了使用排列测试区分可靠和不可靠模型的能力.
- 验证了KP样本对未标记数据分类的潜力.
结论:
- 转换测试为PU学习提供了基线"无信息率".
- 这个基准有助于比较和验证半监督学习模型的性能.
- 该方法为评估PU模型质量提供了可靠的方法.


