Matemáticas para ciencia de datos · Lección 7 de 10
Probabilidad y clasificación
Aplicar Bayes a la evaluación de un modelo.
Antes de empezar, una de repaso
Recordar algo cuesta más que releerlo, y por eso funciona mejor. Esta pregunta es de una lección anterior.
Precisión no es exactitud
Un modelo que detecta fraude puede acertar el 99,9 % de las veces sin servir para nada: si solo el 0,1 % de las operaciones son fraudulentas, decir siempre «no hay fraude» ya acierta el 99,9 %.
Por eso se usan la precisión y la exhaustividad, que miden qué fracción de las alarmas son reales y qué fracción de los casos reales se detecta.
Bayes otra vez
La pregunta «si el modelo dice fraude, ¿qué probabilidad hay de que lo sea?» es exactamente el problema del test médico del curso de probabilidad.
Y la respuesta depende críticamente de cuántos casos positivos hay de partida. Con eventos raros, la mayoría de las alarmas serán falsas por muy bueno que sea el modelo.
El umbral es una decisión
Bajar el umbral detecta más casos reales y genera más falsas alarmas; subirlo hace lo contrario. No hay un ajuste óptimo universal.
Depende de qué cuesta más: un falso positivo o un falso negativo. Y esa es una decisión de negocio o de ética, no un cálculo.
Practica
Cada ejercicio se genera con números nuevos y lo corrige el mismo motor que mueve las calculadoras del sitio. La lección se da por dominada al acertar 4 de los últimos 5.
¿Quieres comprobar tus propios números? Esta calculadora resuelve lo mismo paso a paso: Teorema de Bayes.