Matemáticas para ciencia de datos · Lección 9 de 10
Optimizar es derivar
Ver el entrenamiento de un modelo como una búsqueda de mínimo.
Antes de empezar, una de repaso
Recordar algo cuesta más que releerlo, y por eso funciona mejor. Esta pregunta es de una lección anterior.
La función de pérdida
Entrenar un modelo es elegir los parámetros que minimizan una medida del error. Esa medida es una función, y minimizar una función es exactamente lo que enseña el cálculo diferencial.
En la regresión lineal esa función es la suma de cuadrados, y tiene solución exacta. En modelos complejos no la hay, y hay que buscar.
El descenso de gradiente
Se calcula la derivada de la pérdida respecto a cada parámetro y se da un pequeño paso en la dirección en la que la pérdida baja. Se repite hasta que deja de mejorar.
Es literalmente bajar una ladera a tientas mirando la pendiente bajo los pies. Todo el aprendizaje profundo se apoya en esa idea.
El tamaño del paso
Un paso demasiado grande hace que el proceso salte por encima del mínimo y oscile sin converger; uno demasiado pequeño tarda muchísimo.
Ajustar ese ritmo de aprendizaje es una de las decisiones prácticas más importantes al entrenar un modelo, y no hay una fórmula: se prueba.
Practica
Cada ejercicio se genera con números nuevos y lo corrige el mismo motor que mueve las calculadoras del sitio. La lección se da por dominada al acertar 4 de los últimos 5.
¿Quieres comprobar tus propios números? Esta calculadora resuelve lo mismo paso a paso: Calculadora de derivadas.