Video Experimental Relacionado
Updated: Feb 4, 2026

In Silico Modeling Method for Computational Aquatic Toxicology of Endocrine Disruptors: A Software-Based Approach Using QSAR Toolbox
Published on: August 28, 2019
Hacia QSAR más confiables: Una discusión sistemática sobre la partición de conjuntos de datos
1School of Environmental Science and Engineering, Tianjin University, Tianjin 300072, China.
Los métodos de división de datos y las semillas aleatorias afectan significativamente la generalización de los modelos QSAR. La selección cuidadosa de los conjuntos de prueba es crucial para una evaluación fiable del modelo, evitando métricas de rendimiento infladas.
Área de la Ciencia:
- Modelado de Relaciones Cuantitativas Estructura-Actividad (QSAR); quimioinformática; química computacional
Sus antecedentes:
- El desarrollo de modelos QSAR está aumentando rápidamente.
- Existen preocupaciones sobre el rigor de la evaluación de modelos QSAR, especialmente en lo que respecta a las estrategias de división de datos.
- La influencia de la partición de datos en la generalización del modelo necesita una investigación sistemática.
Objetivo del estudio:
- Evaluar sistemáticamente el impacto de las divisiones aleatorias (RS), las divisiones basadas en la similitud (SS) y la variabilidad de las semillas aleatorias en la generalización de los modelos QSAR.
- Evaluar estos efectos en escenarios con datos limitados (cribado químico) y datos abundantes (modelado estándar).
- Desafiar la suposición de que las divisiones racionales que optimizan el rendimiento interno mejoran universalmente el rendimiento del modelo.
Principales métodos:
- Se utilizaron cinco conjuntos de datos de diferentes tamaños.
- Se compararon divisiones aleatorias (RS) y divisiones basadas en la similitud (SS).
- Se investigó el efecto de la variabilidad de las semillas aleatorias en el rendimiento del modelo.
Principales resultados:
- Tanto el método de partición de datos como la selección de la semilla aleatoria afectan sustancialmente el rendimiento de las pruebas internas, lo que podría tergiversar la capacidad predictiva real.
- Las divisiones basadas en la similitud (SS) pueden mejorar el rendimiento interno, pero no siempre la generalización externa.
- En proporciones de muestreo bajas, SS puede tener un rendimiento inferior a las divisiones aleatorias (RS) tanto en pruebas internas como externas.
- Se observó una alta variabilidad en R-cuadrado entre las semillas aleatorias para las pruebas internas en el conjunto de datos más pequeño, en contraste con una menor variabilidad en un conjunto de datos externo fijo.
- El filtrado del dominio de aplicabilidad (AD) no redujo consistentemente la variabilidad en el conjunto de datos externo.
Conclusiones:
- La construcción del conjunto de prueba debe alinearse con los escenarios de aplicación del mundo real para los modelos QSAR.
- Los investigadores deben evitar semillas aleatorias únicas o seleccionadas y métodos de partición racional inadecuados.
- Los protocolos de partición transparentes y alineados con la aplicación, y los métodos de AD son esenciales para priorizar la generalización externa real sobre las métricas internas potencialmente infladas.
Videos de Conceptos Relacionados
Design Example: Setting a Curve Using Design Data
Random and Systematic Errors
Extraction: Partition and Distribution Coefficients
For extracting a solute from an aqueous phase into an...
Systematic Sampling Method
Systematic sampling is one of the simplest methods...
Propagation of Uncertainty from Systematic Error
Setting Time of Cement

