Matemáticas para ciencia de datos · Lección 10 de 10
Errores que falsean conclusiones
Reconocer los fallos metodológicos más frecuentes.
Antes de empezar, una de repaso
Recordar algo cuesta más que releerlo, y por eso funciona mejor. Esta pregunta es de una lección anterior.
Sobreajuste
Un modelo lo bastante flexible puede memorizar los datos de entrenamiento y fallar con datos nuevos. Un ajuste perfecto no es una buena noticia: es una señal de alarma.
Por eso se evalúa siempre sobre datos que el modelo no ha visto. Un resultado medido sobre los datos de entrenamiento no significa nada.
Sesgo de selección
Si los datos no representan a la población sobre la que se va a decidir, el modelo hereda ese sesgo y lo aplica a escala.
El caso de los aviones de la Segunda Guerra Mundial lo ilustra: analizar solo los que volvían daba conclusiones invertidas, porque los que no volvían faltaban de la muestra.
La paradoja de Simpson
Una tendencia puede aparecer en varios grupos y desaparecer o invertirse al juntarlos. No es una anomalía estadística: es lo que pasa cuando se ignora una variable relevante.
Es la razón definitiva para no fiarse de un agregado sin mirar los subgrupos, y probablemente el fenómeno más contraintuitivo de toda la estadística aplicada.
Practica
Cada ejercicio se genera con números nuevos y lo corrige el mismo motor que mueve las calculadoras del sitio. La lección se da por dominada al acertar 4 de los últimos 5.
¿Quieres comprobar tus propios números? Esta calculadora resuelve lo mismo paso a paso: Coeficiente de correlación.