Reportes de Meta Ads
Prueba A/B en Meta Ads: cómo hacerla sin engañarse
Por qué la mayoría de las pruebas A/B en Meta no prueban nada, qué variable aislar, cuánto volumen hace falta y cuándo conviene no probar.
Este artículo también está en: Português · English
Casi todo el mundo dice que hace pruebas A/B en Meta Ads. Bastante poca gente hace pruebas de las que se pueda concluir algo. La diferencia no está en la herramienta — está en tres decisiones que se toman antes de subir el anuncio.
El problema de fondo
Una prueba sirve para responder una pregunta con menos incertidumbre de la que había antes. Si al terminar seguís sin poder decir cuál variante ganó, no fue una prueba: fue gasto con dos creativos.
Y eso pasa seguido, por motivos que son predecibles: volumen insuficiente, más de una variable cambiada al mismo tiempo, o reparto de presupuesto desigual entre las variantes.
Las tres se resuelven antes de empezar. Ninguna se arregla después, mirando el reporte.
Una variable por vez
Es la regla más citada y la más violada. Se prueban "dos creativos" que difieren en imagen, en texto, en encabezado y en llamada a la acción, y cuando uno gana nadie sabe por qué.
Eso sería aceptable si el único objetivo fuera elegir el mejor de esos dos. Pero el motivo real de probar es aprender algo reutilizable — que el ángulo de tiempo funciona mejor que el de precio, que el video supera a la imagen en este público. Un resultado sin causa identificada no se puede aplicar a la próxima pieza.
Si querés comparar dos conceptos enteros, hacelo — y llamalo comparación, no prueba. El nombre importa porque define qué se puede concluir.
Volumen: la restricción que decide todo
Una diferencia de diez por ciento entre variantes es indistinguible del ruido cuando cada una tiene quince conversiones. Con esos números, repetir la misma prueba la semana siguiente puede dar el resultado opuesto.
Antes de armar la prueba conviene hacer una cuenta rápida: cuántas conversiones produce la campaña por semana y cuántas le tocarían a cada variante. Si el número por variante es chico, hay dos caminos honestos.
El primero es probar sobre un evento más frecuente —clics, visitas a la página de producto— aceptando que es un indicador intermedio y no la conversión final.
El segundo es no probar y decidir por criterio. Es una respuesta legítima, y bastante mejor que ejecutar una prueba que va a producir una conclusión falsa con aire de dato.
Cómo repartir el gasto de forma pareja
Si las variantes conviven en el mismo conjunto, la plataforma va a concentrar el gasto en la que arranque mejor. Eso es deseable en operación y fatal en una prueba: la variante perdedora casi no se probó.
Para medir hacen falta conjuntos separados con presupuesto propio —ABO— o la herramienta de prueba A/B de la propia plataforma, que divide el público para que las variantes no compitan entre sí.
La división del público importa más de lo que parece. Sin ella, las dos variantes pujan por las mismas personas, y parte de la diferencia observada viene de la subasta, no del creativo.
Cuánto tiempo dejarla correr
Dos restricciones, y hay que cumplir las dos.
Un ciclo semanal completo, como mínimo. El comportamiento de lunes no se parece al de sábado, y una prueba de tres días puede estar midiendo el día de la semana.
Volumen suficiente por variante. Si al terminar la semana los números siguen siendo chicos, la prueba continúa. Cortar por calendario cuando falta volumen es la forma más común de llegar a una conclusión inventada.
Y una restricción negativa: no tocar nada mientras corre. Ajustar presupuesto, público o creativo a mitad de camino invalida la comparación, aunque el ajuste haya sido bienintencionado.
Qué probar, en orden de retorno
No todas las variables rinden lo mismo. Por experiencia acumulada, el orden aproximado es:
El ángulo del mensaje. Es lo que más mueve el resultado y lo que menos se prueba.
El formato. Video contra imagen, vertical contra cuadrado — cambios grandes de desempeño, fáciles de ejecutar.
El público. Vale sobre todo cuando hay una hipótesis concreta, no para comparar intereses al azar.
La página de destino. Alto impacto y ciclo largo, porque involucra a más gente para implementar.
Al final de la lista está todo lo cosmético: color del botón, fuente, orden de los elementos. Rara vez producen una diferencia que sobreviva al ruido.
El costo oculto de probar todo
Hay un punto que rara vez se dice: probar cuesta dinero, y no solo el del presupuesto asignado a la variante perdedora.
Cada prueba reinicia aprendizaje, ocupa atención del equipo y retrasa la decisión. Una cuenta que vive probando pasa buena parte del mes en estado inestable, y termina con peor desempeño que una que decide por criterio y deja correr.
La regla práctica que funciona: probar lo que se va a repetir muchas veces, decidir por criterio lo que es puntual. Vale probar el ángulo del mensaje, porque la respuesta se aplica a los próximos veinte creativos. No vale probar la miniatura de la campaña de la semana que viene.
Cuando el resultado es "empate"
Buena parte de las pruebas terminan sin diferencia clara, y eso se vive como fracaso. No lo es — es información.
Un empate significa que esa variable no es la palanca. Si el ángulo A y el ángulo B rinden igual, el problema de la campaña está en otro lado: el público, la oferta, la página. Seguir produciendo variaciones de creativo en ese escenario es trabajar donde no hay retorno.
Tratar el empate como resultado válido y cambiar de variable es lo que separa un programa de pruebas de una rutina de producir piezas.
Qué hacer con el resultado
Una prueba terminada debería producir dos cosas: una decisión y una frase escrita en algún lado.
La decisión es obvia — se queda el ganador. La frase es lo que casi nadie guarda: "en esta cuenta, el ángulo de ahorro de tiempo superó al de precio en público frío, en septiembre". Seis meses después, ese registro vale más que el creativo ganador, que ya va a estar fatigado.
Los equipos que acumulan ese archivo dejan de repetir las mismas pruebas cada seis meses, que es donde se pierde la mayor parte del presupuesto de experimentación.
Para entender por qué los primeros días de una variante nueva no sirven para concluir, la fase de aprendizaje. Para separar presupuesto de forma pareja, CBO o ABO. Y para armar la lectura semanal sin exportar, el reporte de tráfico pago.
Preguntas frecuentes
¿Cuántos resultados hace falta para confiar en una prueba?
No hay un número único, pero con menos de unas decenas de conversiones por variante la diferencia observada es indistinguible del azar.
¿Sirve poner dos creativos en el mismo conjunto?
Sirve para dejar que la plataforma elija el mejor, no para medir cuál es mejor: el reparto de gasto es desigual por diseño.
¿Cuánto debe durar una prueba?
Al menos un ciclo semanal completo, para que no quede sesgada por el comportamiento de días específicos, y hasta acumular volumen suficiente.
¿Se puede probar más de una variable a la vez?
Se puede, pero el resultado no dice cuál de las dos causó la diferencia. Para decidir algo, una variable por prueba.