Tienes dos anuncios en el mismo grupo. Uno lleva 1,5 % de CTR y el otro, 1,0 %. Parece fácil: gana el primero, archivas el segundo y a otra cosa.
Esa decisión es una moneda al aire disfrazada de análisis. Y en ChatGPT Ads (OpenAI la llama en español «ChatGPT Anuncios») duele más que en Google Ads: los volúmenes son pequeños y cada prueba tarda semanas.
Por qué dos CTR no bastan
Un CTR no es una propiedad del anuncio: es el resultado de un sorteo. Con la misma creatividad, dos días distintos dan cifras distintas. No comparas dos números, sino dos estimaciones con ruido.
Y el ruido tiene tamaño conocido: un recuento se mueve, por azar, en torno a su raíz cuadrada. Un anuncio con 30 clics podría haber tenido 24 o 36 sin que cambiara nada. Por eso 10 clics de diferencia entre dos anuncios pequeños no significan nada, y la misma diferencia proporcional con diez veces más datos sí.
⚠️ Trampa: el error no es solo elegir mal. Es archivar un anuncio que era igual de bueno, perder su hueco de prueba y creer que has aprendido algo. Las decisiones falsas contaminan las siguientes.
Qué significa «significativo», en llano
Que una diferencia sea estadísticamente significativa con p < 0,05 quiere decir esto: si los dos anuncios fueran en realidad iguales, una diferencia tan grande como la que veo aparecería por puro azar menos de una vez de cada veinte. No demuestra que uno sea mejor; es un umbral de prudencia que descarta las casualidades más frecuentes.
Dos matices que lo hacen útil:
- Significativo no es importante. Con muchísimos datos, una diferencia del 0,5 % puede ser significativa y no merecer ni un cambio. Por eso se exige, además, un tamaño mínimo de diferencia.
- No significativo no es «son iguales». Casi siempre quiere decir «todavía no lo sé». Afirmar que dos anuncios empatan exige más muestra que declarar un ganador, no menos.
El método de la casa
Es el que aplicamos nosotros, y está pensado para volúmenes pequeños:
| Regla | Umbral | Por qué |
|---|---|---|
| Mínimos por rama | 500 impresiones, 20 clics y 3 días completos | Por debajo no se mira: cualquier cifra es ruido |
| Declarar ganador | Significativa (p < 0,05) y al menos un 10 % relativo | Lo primero descarta el azar; lo segundo, lo que no compensa cambiar |
| Declarar empate | Cuatro veces los mínimos (2.000 impresiones y 80 clics) y ninguna señal | Afirmar que no hay diferencia exige más datos que encontrarla |
| Cierre por tiempo | 28 días | Una prueba eterna bloquea el hueco de la siguiente |
| Tasa de conversión | Solo manda con ≥ 5 conversiones por rama | Con menos es la métrica más ruidosa de todas |
Con conversiones suficientes en las dos ramas manda la tasa de conversión, que es lo que pagas; si no llegan a ese suelo, decide el CTR, la señal que antes se estabiliza.
💡 Truco ninja: el atajo mental, válido cuando las dos ramas han recibido impresiones parecidas: la diferencia de clics tiene que superar el doble de la raíz cuadrada de la suma de los dos recuentos. Es, con otras palabras, el mismo cálculo que hace la prueba estadística.
Un ejemplo resuelto
Dos anuncios del mismo grupo, con reparto parecido de impresiones, en dos momentos y con el mismo CTR:
| Momento | Anuncio | Impresiones | Clics | CTR |
|---|---|---|---|---|
| Semana 1 | A | 2.000 | 30 | 1,50 % |
| Semana 1 | B | 2.000 | 20 | 1,00 % |
| Día 10 | A | 6.000 | 90 | 1,50 % |
| Día 10 | B | 6.000 | 60 | 1,00 % |
Semana 1. A parece un 50 % mejor. Atajo: 30 + 20 = 50 clics; raíz 7,1; el doble, 14,2. La diferencia real es de 10 clics, por debajo del listón. La prueba formal dice lo mismo: p ≈ 0,15, o sea que algo así saldría por azar una de cada siete veces. Veredicto: falta muestra, no se toca nada.
Día 10. 90 + 60 = 150; raíz 12,2; el doble, 24,5. La diferencia es de 30 clics y lo supera. La prueba formal: p ≈ 0,014. La diferencia relativa (50 %) pasa de sobra el 10 % exigido y ambas ramas superan los mínimos. Veredicto: gana A.
Mismos porcentajes, decisión opuesta. Lo único que cambió fue la cantidad de datos, que es justo lo que no se puede improvisar.
El límite honesto: es una comparación observacional
En ChatGPT Ads no se puede controlar la rotación de los anuncios de un grupo (comprobado por nosotros, septiembre de 2026): la plataforma decide a quién enseña cada uno. Las dos ramas no reciben públicos idénticos, así que parte de la diferencia puede venir del reparto y no de la creatividad.
No lo invalida, pero obliga a ser más exigente: por eso los mínimos son altos, se piden tres días completos (para que entren distintos momentos de la semana) y se exige, además del test, un 10 % relativo. Un experimento de laboratorio esto no es, y conviene decirlo.
Qué hacer con cada veredicto
- Ganador: pasa a ser el anuncio de referencia y el perdedor se archiva, nunca se pausa. Un «activar todos» resucita lo pausado y te devuelve a la casilla de salida.
- Empate: se queda el más antiguo, que ya tiene historial, y se libera el hueco para la siguiente hipótesis.
- Falta muestra a los 28 días: se cierra sin conclusión y se anota. Te dice que con tu presupuesto esa variable no se puede medir y que la próxima prueba debe ser más atrevida.
Y una regla de higiene: una prueba viva por grupo. Con dos a la vez no se sabe a cuál atribuir el cambio. Cómo montar las variantes está en «Anuncio y landing en ChatGPT Ads»; la rutina semanal que las encadena, en «Optimizar ChatGPT Ads sin términos de búsqueda».
📌 Haz la cuenta antes de empezar: con un presupuesto pequeño y un clic de varios euros (las cifras que circulan, de agencias como Choice OMG en 2026, no de OpenAI, hablan de 3-5 $), llegar a 20 clics por rama puede llevar semanas. Menos variantes a la vez y más tiempo cada una.
Lo que te llevas
- Un CTR es una estimación con ruido: el azar mueve un recuento en torno a su raíz cuadrada.
- Mínimos por rama antes de mirar nada: 500 impresiones, 20 clics y 3 días completos.
- Ganador solo con p < 0,05 y un 10 % relativo; empate solo con cuatro veces los mínimos; cierre a los 28 días.
- La tasa de conversión manda únicamente con 5 o más conversiones por rama; si no, decide el CTR.
- Sin control de la rotación, la comparación es observacional: por eso se exige más muestra, no menos.
- Al perdedor se le archiva, y solo una prueba viva por grupo.