Pruebas de hipótesis
Mover el umbral de decisión reparte el riesgo entre los dos errores posibles, pero no lo reduce. Lo único que baja los dos a la vez es medir más, y cuál de los dos duele más es una decisión de ingeniería.
01Cómo se plantea una prueba
Una prueba de hipótesis decide entre dos afirmaciones con datos. La estructura es siempre la misma y es deliberadamente asimétrica: se parte de suponer que no pasa nada y solo se abandona esa suposición si los datos la vuelven muy poco creíble.
| Qué afirma | Su papel | |
|---|---|---|
| \( H_0 \), nula | No hay efecto, no hay diferencia | Se sostiene salvo prueba en contrario |
| \( H_1 \), alternativa | Sí hay efecto | Es lo que hay que demostrar |
La asimetría es intencional y se parece a la de un juicio: la inocencia no se demuestra, se presume. Por eso el resultado de una prueba nunca es «\( H_0 \) es verdadera», sino «no hay evidencia suficiente para rechazarla», que es bastante menos.
02Los dos errores
Cualquier decisión con datos limitados puede equivocarse de dos maneras, y las dos tienen nombre porque no son intercambiables.
| \( H_0 \) es verdadera | \( H_0 \) es falsa | |
|---|---|---|
| Se rechaza | Error de tipo I, probabilidad \( \alpha \) | Correcto: potencia \( 1-\beta \) |
| No se rechaza | Correcto | Error de tipo II, probabilidad \( \beta \) |
En control de calidad tienen nombre propio: el riesgo del productor es rechazar un lote que estaba bien, y el riesgo del consumidor, aceptar uno que estaba mal. Cuál de los dos duele más depende de qué se está fabricando, y esa decisión es de ingeniería, no de estadística.
Las dos distribuciones —la de \( H_0 \) y la de \( H_1 \)— con el umbral de decisión en el medio. Movelo y mirá cómo un error crece cuando el otro baja. Después subí el tamaño de muestra y mirá qué pasa con los dos a la vez.
03El valor p, y lo que no es
El valor p es la probabilidad de observar un resultado al menos tan extremo como el obtenido suponiendo que \( H_0 \) es verdadera. Si es menor que \( \alpha \), se rechaza.
No es la probabilidad de que \( H_0 \) sea verdadera: está calculado suponiendo que lo es. No es la probabilidad de haberse equivocado al rechazar. Y no mide el tamaño del efecto: con una muestra lo bastante grande, una diferencia insignificante da un p diminuto. Un resultado puede ser estadísticamente significativo y prácticamente irrelevante, y esa distinción es la más importante de toda la unidad.
| Situación | Decisión | Qué significa de verdad |
|---|---|---|
| \( p = 0{,}001 \), efecto de 0,01 % | Se rechaza \( H_0 \) | La diferencia existe y no importa |
| \( p = 0{,}20 \), efecto de 30 % | No se rechaza | Puede haber un efecto grande y faltan datos |
| \( p = 0{,}049 \) contra \( p = 0{,}051 \) | Rechaza / no rechaza | Son prácticamente el mismo resultado |
La tercera fila es contra el umbral mágico. El 0,05 es una convención de Fisher, no una ley natural, y tratar 0,049 y 0,051 como conclusiones opuestas es un artificio. Lo razonable es informar el valor p junto con el tamaño del efecto y su intervalo de confianza, y dejar que quien lea juzgue.
04En el laboratorio
Medir veinte resistores de cada uno de dos lotes distintos del mismo valor nominal. Plantear la hipótesis de que las medias son iguales, calcular el estadístico t y el valor p, y decidir con \( \alpha = 0{,}05 \).
Con el desvío medido, calcular qué diferencia entre lotes podría detectarse con 80 % de potencia usando veinte mediciones por lote. Recalcular para cincuenta y comparar.
Simular dos conjuntos de mil datos que difieran en 0,1 % de la media. Verificar que el valor p da muy chico y discutir si esa diferencia justificaría rechazar un lote en producción.
05Errores frecuentes
- Decir que se «aceptó \( H_0 \)». No se rechazó, que es distinto: puede faltar evidencia.
- Interpretar el valor p como la probabilidad de que \( H_0 \) sea cierta. Está calculado suponiendo que lo es.
- Confundir significativo con importante. Con mucha muestra, cualquier diferencia da significativa.
- Bajar \( \alpha \) sin mirar \( \beta \). Reducir un error agranda el otro.
- Elegir la hipótesis después de ver los datos. Eso invalida la prueba entera.
- Probar muchas cosas y reportar la que dio. Con veinte pruebas al 5 %, una da significativa por puro azar.
06Autoevaluación
¿Qué es un error de tipo I?
Rechazar \( H_0 \) siendo verdadera. Su probabilidad es \( \alpha \), el nivel de significación.
¿Qué es la potencia de una prueba?
\( 1-\beta \): la probabilidad de detectar un efecto que realmente existe.
¿Cómo se reducen los dos errores a la vez?
Aumentando el tamaño de muestra. Mover el umbral solo intercambia uno por el otro.
¿Qué significa \( p = 0{,}03 \)?
Que si \( H_0 \) fuera verdadera, un resultado así de extremo ocurriría el 3 % de las veces.
¿Puede un resultado ser significativo y no importar?
Sí, y es frecuente. Con muestras grandes, diferencias despreciables dan valores p muy chicos.
¿Qué es el riesgo del consumidor?
Aceptar un lote que estaba mal: un error de tipo II en el contexto del control de calidad.
07Para ampliar
- Douglas C. Montgomery y George C. Runger. Probabilidad y estadística aplicadas a la ingeniería. 7.ª ed., Wiley, 2018. Los capítulos 9 y 10: pruebas para una y dos muestras, potencia y tamaño de muestra.
- Ronald L. Wasserstein y Nicole A. Lazar. The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, vol. 70, 2016. La declaración oficial de la Asociación Americana de Estadística sobre qué dice y qué no dice un valor p. Seis páginas que conviene leer.
- Douglas C. Montgomery. Introducción al control estadístico de la calidad. 6.ª ed., Wiley, 2009. Riesgo del productor y del consumidor, planes de muestreo y gráficos de control aplicados a producción.