Matemáticas para ciencia de datos
La ciencia de datos no es una rama nueva de las matemáticas: es una combinación concreta de cuatro que ya existían. Estadística para resumir y para decidir si un resultado es real; probabilidad para razonar con incertidumbre; álgebra lineal para representar los datos y operar con ellos a gran escala; y cálculo para entrenar modelos, que no es más que buscar un mínimo. Este curso recorre esa selección con el énfasis puesto en qué se usa para qué, y en los errores de interpretación que producen conclusiones falsas con datos correctos.
Lecciones
- 1 Resumir datos sin engañar Elegir la medida de centro adecuada a la forma de los datos.
- 2 Escalar y tipificar Poner variables distintas en la misma escala.
- 3 Correlación Medir la relación entre dos variables y conocer sus límites.
- 4 Regresión lineal Ajustar una recta a unos datos e interpretar sus coeficientes.
- 5 Los datos como matriz Ver un conjunto de datos como una tabla de números que se puede operar.
- 6 Transformar datos con matrices Entender el producto de matrices como una transformación aplicada a todos los datos.
- 7 Probabilidad y clasificación Aplicar Bayes a la evaluación de un modelo.
- 8 Muestreo e incertidumbre Cuantificar cuánta confianza merece un resultado.
- 9 Optimizar es derivar Ver el entrenamiento de un modelo como una búsqueda de mínimo.
- 10 Errores que falsean conclusiones Reconocer los fallos metodológicos más frecuentes.
Examen final
14 preguntas sorteadas de todas las lecciones. Hace falta un 70 % para aprobar, y al suspender hay que esperar 12 horas antes de repetir: si se pudiera reintentar sin límite, aprobar sería cuestión de insistir y el diploma no diría nada.
Te recomendamos dominar todas las lecciones antes de presentarte.
Ir al examenPreguntas frecuentes
¿Qué matemáticas hacen falta para la ciencia de datos?
Estadística descriptiva e inferencia, probabilidad, álgebra lineal para representar y operar los datos, y cálculo diferencial para entender cómo se entrenan los modelos. No hace falta más de lo que cubren esos cuatro cursos.
¿Por qué un modelo con un 99 % de aciertos puede ser inútil?
Si solo el 1 % de los casos son positivos, decir siempre «negativo» ya acierta el 99 %. Con clases desbalanceadas hay que mirar precisión y exhaustividad, no el porcentaje de aciertos.
¿Por qué hay que escalar las variables?
Porque una variable con rango de 0 a 100.000 dominará a otra de 0 a 100 en cualquier algoritmo que mida distancias, aunque sea menos informativa. Tipificar las pone en las mismas unidades.
¿Un ajuste perfecto es buena señal?
Casi siempre es lo contrario: indica que el modelo ha memorizado los datos de entrenamiento. Lo que importa es cómo se comporta con datos que no ha visto nunca.