Saltar al contenido
MasterMath

Calculadora de significancia de un test A/B

Si la diferencia entre dos versiones de una página es real o es ruido. Da el valor p, la mejora relativa y el intervalo de la diferencia, que es lo que de verdad hay que mirar.

Conclusión

—

Conclusión—
Valor p—
Mejora relativa de B—
Diferencia absoluta—
Intervalo de la diferencia—
Confianza observada—
VersiónVisitasConversionesTasa

Cómo se ha calculado

    La fórmula

    z = (p_B − p_A) / √( p̂(1 − p̂)(1/n_A + 1/n_B) )

    Qué significa

    Un test A/B compara dos proporciones de conversión. La pregunta no es cuál tiene el número más alto —siempre habrá uno más alto— sino si esa diferencia se explica por el azar de quién entró en cada versión. El contraste calcula cuántos errores estándar separan a las dos tasas y traduce eso a una probabilidad: si es muy pequeña, el azar es una mala explicación.

    Cómo calcularlo a mano

    1. Calcula la tasa de conversión de cada versión
    2. Calcula la proporción común juntando las dos y su error estándar
    3. Divide la diferencia de tasas entre ese error: ese es el estadístico z
    4. Traduce z a un valor p y compáralo con el nivel que hayas fijado

    Lo que conviene saber

    Mirar el test cada día y pararlo en cuanto salga significativo es la forma más habitual de engañarse: con suficientes miradas, casi cualquier test cruza el umbral en algún momento aunque no haya diferencia real. Hay que fijar de antemano el tamaño de muestra y esperar. Y la mejora relativa, que es la cifra que se lleva a la reunión, es la más inestable de todas: un intervalo de la diferencia que va del 0,1 % al 3 % puede corresponder a una mejora relativa de entre el 2 % y el 60 %.

    Preguntas frecuentes

    ¿Cuándo puedo parar el test?

    Cuando llegues al tamaño de muestra que fijaste antes de empezar. Parar en cuanto sale significativo infla muchísimo los falsos positivos.

    ¿Qué significa el valor p aquí?

    La probabilidad de ver una diferencia al menos así de grande si las dos versiones fueran realmente iguales.

    ¿Por qué el intervalo es más importante que el valor p?

    Porque dice cuánto puede ser la mejora, no solo si existe. Un resultado significativo con un intervalo que va del 0,1 % al 3 % es casi inútil para decidir.

    ¿Mejora relativa o absoluta?

    La absoluta es la que manda para el cálculo; la relativa es la que impresiona. Conviene dar las dos y no fiarse de la segunda a solas.

    ¿Cuántas visitas necesito?

    Depende de la tasa de partida y de la mejora que quieras detectar. La calculadora de tamaño de muestra da el orden de magnitud.