Saltar al contenido
MasterMath

Matemáticas para ciencia de datos · Lección 10 de 10

Errores que falsean conclusiones

Reconocer los fallos metodológicos más frecuentes.

Sobreajuste

Un modelo lo bastante flexible puede memorizar los datos de entrenamiento y fallar con datos nuevos. Un ajuste perfecto no es una buena noticia: es una señal de alarma.

Por eso se evalúa siempre sobre datos que el modelo no ha visto. Un resultado medido sobre los datos de entrenamiento no significa nada.

Sesgo de selección

Si los datos no representan a la población sobre la que se va a decidir, el modelo hereda ese sesgo y lo aplica a escala.

El caso de los aviones de la Segunda Guerra Mundial lo ilustra: analizar solo los que volvían daba conclusiones invertidas, porque los que no volvían faltaban de la muestra.

La paradoja de Simpson

Una tendencia puede aparecer en varios grupos y desaparecer o invertirse al juntarlos. No es una anomalía estadística: es lo que pasa cuando se ignora una variable relevante.

Es la razón definitiva para no fiarse de un agregado sin mirar los subgrupos, y probablemente el fenómeno más contraintuitivo de toda la estadística aplicada.

Practica

Cada ejercicio se genera con números nuevos y lo corrige el mismo motor que mueve las calculadoras del sitio. La lección se da por dominada al acertar 4 de los últimos 5.

¿Quieres comprobar tus propios números? Esta calculadora resuelve lo mismo paso a paso: Coeficiente de correlación.