Matemáticas para ciencia de datos · Lección 2 de 10
Escalar y tipificar
Poner variables distintas en la misma escala.
Antes de empezar, una de repaso
Recordar algo cuesta más que releerlo, y por eso funciona mejor. Esta pregunta es de una lección anterior.
Por qué hace falta
Si una variable son euros —de 0 a 100.000— y otra son años —de 0 a 100—, cualquier algoritmo que mida distancias dará casi todo el peso a la primera solo por su escala.
Tipificar restando la media y dividiendo entre la desviación típica pone todas las variables en las mismas unidades: desviaciones respecto a su propia media.
Dos formas de escalar
La tipificación deja media cero y desviación uno, y es la habitual. La normalización comprime los datos al intervalo de 0 a 1, y es más sensible a los valores extremos.
Cuál usar depende del algoritmo, pero omitir el escalado casi nunca es la opción correcta.
El error de escalar antes de separar
Si se calcula la media y la desviación con todos los datos y después se separa en entrenamiento y prueba, la información del conjunto de prueba se ha filtrado al modelo.
El resultado parece mejor de lo que es. Se llama fuga de datos y es uno de los errores metodológicos más frecuentes y más difíciles de detectar.
Practica
Cada ejercicio se genera con números nuevos y lo corrige el mismo motor que mueve las calculadoras del sitio. La lección se da por dominada al acertar 4 de los últimos 5.
¿Quieres comprobar tus propios números? Esta calculadora resuelve lo mismo paso a paso: Distribución normal.