Saltar al contenido
MasterMath
Avanzado

Matemáticas para ciencia de datos

La ciencia de datos no es una rama nueva de las matemáticas: es una combinación concreta de cuatro que ya existían. Estadística para resumir y para decidir si un resultado es real; probabilidad para razonar con incertidumbre; álgebra lineal para representar los datos y operar con ellos a gran escala; y cálculo para entrenar modelos, que no es más que buscar un mínimo. Este curso recorre esa selección con el énfasis puesto en qué se usa para qué, y en los errores de interpretación que producen conclusiones falsas con datos correctos.

Aún no has empezado 10 lecciones te esperan.
Empezar el curso

Lecciones

  1. 1 Resumir datos sin engañar Elegir la medida de centro adecuada a la forma de los datos.
  2. 2 Escalar y tipificar Poner variables distintas en la misma escala.
  3. 3 Correlación Medir la relación entre dos variables y conocer sus límites.
  4. 4 Regresión lineal Ajustar una recta a unos datos e interpretar sus coeficientes.
  5. 5 Los datos como matriz Ver un conjunto de datos como una tabla de números que se puede operar.
  6. 6 Transformar datos con matrices Entender el producto de matrices como una transformación aplicada a todos los datos.
  7. 7 Probabilidad y clasificación Aplicar Bayes a la evaluación de un modelo.
  8. 8 Muestreo e incertidumbre Cuantificar cuánta confianza merece un resultado.
  9. 9 Optimizar es derivar Ver el entrenamiento de un modelo como una búsqueda de mínimo.
  10. 10 Errores que falsean conclusiones Reconocer los fallos metodológicos más frecuentes.

Examen final

14 preguntas sorteadas de todas las lecciones. Hace falta un 70 % para aprobar, y al suspender hay que esperar 12 horas antes de repetir: si se pudiera reintentar sin límite, aprobar sería cuestión de insistir y el diploma no diría nada.

Te recomendamos dominar todas las lecciones antes de presentarte.

Ir al examen

Preguntas frecuentes

¿Qué matemáticas hacen falta para la ciencia de datos?

Estadística descriptiva e inferencia, probabilidad, álgebra lineal para representar y operar los datos, y cálculo diferencial para entender cómo se entrenan los modelos. No hace falta más de lo que cubren esos cuatro cursos.

¿Por qué un modelo con un 99 % de aciertos puede ser inútil?

Si solo el 1 % de los casos son positivos, decir siempre «negativo» ya acierta el 99 %. Con clases desbalanceadas hay que mirar precisión y exhaustividad, no el porcentaje de aciertos.

¿Por qué hay que escalar las variables?

Porque una variable con rango de 0 a 100.000 dominará a otra de 0 a 100 en cualquier algoritmo que mida distancias, aunque sea menos informativa. Tipificar las pone en las mismas unidades.

¿Un ajuste perfecto es buena señal?

Casi siempre es lo contrario: indica que el modelo ha memorizado los datos de entrenamiento. Lo que importa es cómo se comporta con datos que no ha visto nunca.