Relatórios de Meta Ads
Teste A/B no Meta Ads: como montar um que responda alguma coisa
Teste A/B no Meta Ads só responde quando muda uma variável, tem hipótese escrita e volume suficiente. Veja como montar e o que invalida o teste.
Este artigo também está em: English · Español
Um teste A/B no Meta Ads responde alguma coisa quando cumpre quatro condições, todas antes de ligar: muda uma variável só, tem hipótese escrita, tem a métrica de decisão definida e dá aos dois lados o mesmo tempo, o mesmo período e a mesma chance de gastar. Sem isso, o que sai é dois números diferentes e nenhuma resposta. Este artigo mostra como montar o teste nessa ordem, por que 20 leads contra 23 não diz nada, o que fazer com o perdedor e o erro que invalida a maioria dos testes: rodar dentro de uma campanha com orçamento otimizado que escolhe um lado antes de você.
Uma variável por vez: criativo, público ou página
A regra é simples e é a mais quebrada: o lado A e o lado B diferem em uma coisa só. Criativo, público ou página de destino. Nunca dois ao mesmo tempo.
O motivo não é purismo. Se o anúncio B tem um vídeo novo e um público novo e ganha, você aprendeu que a combinação ganhou. Não sabe se o vídeo teria ganhado no público antigo, nem o contrário. O próximo teste começa do zero, e o anterior custou verba para ensinar algo que não dá para reaproveitar.
Na prática, escolha a variável pela pergunta que você tem:
- Criativo, quando a dúvida é gancho, formato ou oferta. É o teste mais comum e o que mais muda o custo por resultado.
- Público, quando o criativo já provou e a dúvida é onde ele escala. Teste um público contra outro com o mesmo anúncio, e não anúncios diferentes em públicos diferentes.
- Página de destino, quando os cliques chegam e o resultado não. Mesmo anúncio, mesmo público, duas páginas.
Tudo o que não é a variável fica igual: orçamento, posicionamentos, evento de otimização, cronograma. Duas mudanças são dois testes, um depois do outro. A leitura completa da campanha antes de decidir o que testar está em como analisar campanha de Meta Ads.
A hipótese vem escrita antes de ligar
Um teste sem hipótese é curiosidade com orçamento. A hipótese é uma frase, escrita antes de ligar: "acredito que B vai ter custo por lead menor que A porque X". O "porque" é a parte que importa: obriga você a dizer o que espera aprender, e separa um teste de uma tentativa.
Exemplos que funcionam como hipótese:
- "O vídeo com a dor no primeiro segundo vai ter CPL menor que o vídeo com a marca no primeiro segundo, porque a atenção no feed acaba antes da marca aparecer."
- "O público amplo vai ter CPL igual ou menor que o interesse específico, porque o sistema de entrega encontra quem converte sem a restrição."
- "A página com formulário na primeira dobra vai converter mais, porque metade dos cliques vem de celular e não rola."
Escreva também o que vai fazer com cada resultado. Se B ganhar, vira o padrão. Se A ganhar, a ideia é descartada. Se der empate, nada muda. Decidir isso antes evita o teste que "deu empate, mas vou deixar o B porque gostei mais".
A métrica que decide: custo por resultado, não CTR
A métrica que declara o vencedor é a que está ligada ao objetivo da campanha: custo por resultado. Em campanha de leads, custo por lead. Em campanha de vendas, custo por compra ou ROAS. Definida antes de ligar, junto com a hipótese.
CTR, CPC e CPM entram como diagnóstico, não como veredito. Um anúncio com CTR maior e CPL maior perdeu: chamou mais atenção e trouxe cliques que não viraram lead. O CTR explica por que ele perdeu (o gancho atrai gente errada, ou a página não sustenta a promessa) e alimenta o próximo teste. Mas o veredito é o custo por resultado.
O erro é decidir pela métrica que aparece primeiro. CTR aparece no primeiro dia; lead demora. Quem decide pelo CTR no terceiro dia escolhe o anúncio que mais gera clique, não o que mais gera resultado. A cadeia entre CPM, CTR, CPC e custo por resultado está em métricas do Meta Ads.
Volume: por que 20 leads contra 23 não diz nada
Aqui a maioria dos testes morre. A campanha roda cinco dias, A tem 20 leads, B tem 23, e o relatório diz que B venceu por 15%. Não venceu. B teve três leads a mais num volume em que três leads é ruído.
O raciocínio não precisa de fórmula. Lead é um evento que acontece ou não, pessoa por pessoa. Se você rodar o mesmo anúncio, para o mesmo público, em dois conjuntos idênticos, os dois não terminam com o mesmo número de leads. Terminam com números parecidos, e a diferença entre eles é a variação natural: o que muda de um lado para o outro por acaso, sem causa nenhuma. Com 20 leads, essa variação cabe com folga em três leads de diferença.
O teste prático, sem estatística: pergunte quantos leads precisariam trocar de lado para inverter o resultado. Se a resposta é dois ou três, você tem uma amostra pequena, não um resultado. Se é vinte, você tem algo.
Não existe número mínimo universal, e desconfie de quem diz que existe. O que existe é uma relação: quanto menor o volume, maior a diferença que precisa aparecer para ser sinal. Diferença pequena com volume pequeno não vale nunca, e o certo é estender o teste ou aceitar que ele não respondeu.
Mesma duração, mesmo período, mesmo orçamento
Os dois lados rodam ao mesmo tempo, pelo mesmo número de dias, com o mesmo orçamento. Parece óbvio e é onde entra a segunda leva de testes inválidos.
Mesmo período. A na semana 1 e B na semana 2 não é teste, é comparação de semanas. O leilão muda, um concorrente entra, chega um feriado. A diferença entre A e B fica misturada com a diferença entre as semanas.
Mesma duração, e uma semana inteira. Terça é diferente de sábado. Uma semana completa para os dois, do mesmo dia da semana ao mesmo dia da semana, elimina o peso desigual dos dias. Se uma semana não deu volume, estenda os dois juntos, nunca só um.
Mesmo orçamento. Cada lado tem o seu orçamento, e ele é igual. Se A gastou R$ 900 e B gastou R$ 300, B teve um terço da chance de acumular volume, e o volume é o que valida o teste.
Sem mexer no meio. Uma edição relevante em um dos lados reinicia a calibragem do sistema de entrega para aquele lado, e os dois deixam de ser comparáveis. Isso inclui subir a verba do lado que "está indo bem" no terceiro dia. Se precisa mexer, pare, ajuste os dois e recomece a contagem.
O erro que invalida o teste A/B no Meta Ads: orçamento otimizado
Este erro invalida mais testes do que todos os outros juntos, e quase ninguém percebe: montar A e B como dois conjuntos dentro de uma campanha com orçamento otimizado no nível da campanha.
O mecanismo: com orçamento na campanha, o sistema de entrega distribui a verba entre os conjuntos de acordo com o que ele avalia, a cada momento, como o lado mais eficiente. Nas primeiras horas, com pouco dado, ele forma uma preferência e manda a maior parte da verba para um conjunto. O outro recebe migalhas, nunca acumula volume, e no fim você tem um lado com R$ 850 de gasto e outro com R$ 150. O lado que "perdeu" não perdeu: nunca competiu.
A correção é uma das duas:
- Orçamento no nível do conjunto, igual nos dois lados, sem otimização de campanha. Cada conjunto gasta o seu e o sistema não escolhe por você.
- O recurso de teste A/B do próprio Meta, quando ele está disponível para a variável que você quer testar. Ele divide o público entre os lados sem sobreposição, o que resolve também o problema dos dois conjuntos disputando as mesmas pessoas no leilão.
Se o gasto ficou desigual, não tente corrigir lendo custo por resultado. Refaça.
O que fazer com o perdedor: pausar, não excluir
Terminou o teste, um lado ganhou pela métrica que você definiu, com volume que sustenta a diferença. O que fazer com o outro lado: pausar.
Não excluir. O anúncio ou conjunto pausado guarda tudo: gasto, resultados, quebra por dia, comentários, a data em que rodou. Isso é o histórico da conta, e histórico é o que impede a mesma ideia de ser testada três vezes por três pessoas diferentes. Quem assume a conta daqui a seis meses abre a lista de pausados e vê o que já foi tentado.
Registre fora do Gerenciador também: uma linha por teste, com hipótese, variável, período, gasto e resultado por lado, vencedor e decisão. Uma planilha simples serve. Confiar na memória não serve.
E não tire o vencedor da rotina de observação. Se a frequência sobe e o CTR cai nas semanas seguintes, ele está saturando, e o próximo teste é contra ele.
Um exemplo para mostrar a conta
Números inventados só para mostrar a conta. Campanha de leads, teste de criativo, R$ 120 por dia em cada conjunto, uma semana.
| Criativo A | Criativo B | |
|---|---|---|
| Gasto (7 dias) | R$ 840 | R$ 840 |
| Leads | 20 | 23 |
| CPL | R$ 42,00 | R$ 36,52 |
| CTR no link | 1,1% | 1,4% |
B tem CPL 13% menor e CTR maior. A tentação é declarar vencedor. Aplique o teste dos leads que trocam de lado: se dois leads saíssem de B e entrassem em A, A teria 22 (R$ 38,18) e B teria 21 (R$ 40,00). Inverte com dois leads. Não há resposta ainda.
O teste segue por mais duas semanas, os dois lados juntos, sem edição:
| Criativo A | Criativo B | |
|---|---|---|
| Gasto (21 dias) | R$ 2.520 | R$ 2.520 |
| Leads | 61 | 84 |
| CPL | R$ 41,31 | R$ 30,00 |
Agora B tem CPL 27% menor, e seriam necessários mais de dez leads trocando de lado para inverter. A hipótese se sustenta, B vira o padrão, A é pausado com o histórico intacto e o próximo teste parte de B. O CTR ficou de fora da decisão: ele explica, não decide.
Erro comum, por que invalida e a correção
| Erro comum | Por que invalida o teste | Correção |
|---|---|---|
| Criativo e público mudam juntos | Não dá para saber qual dos dois causou a diferença | Uma variável por teste; encadear os testes |
| Sem hipótese escrita | Qualquer resultado vira "interessante" e nada muda | Uma frase com "porque" antes de ligar, e a decisão para cada desfecho |
| Decidir pelo CTR | CTR chega primeiro e mede atenção, não resultado | Custo por resultado definido antes; CTR como diagnóstico |
| 20 leads contra 23 | A diferença cabe na variação natural | Estender os dois lados até a diferença não inverter com poucos leads |
| A numa semana, B na outra | A diferença entre as semanas se mistura com a diferença entre os lados | Mesmo período, mesma duração, semana inteira |
| Orçamento otimizado na campanha | O sistema escolhe um lado nas primeiras horas e o outro nunca compete | Orçamento igual por conjunto, ou o teste A/B nativo |
| Subir verba do lado que "está indo bem" | Reinicia a calibragem de um lado e desiguala o gasto | Não editar durante o teste; se precisar, recomeçar os dois |
| Excluir o perdedor | Apaga o histórico e o mesmo teste volta a ser feito | Pausar e registrar em uma linha fora do Gerenciador |
Próximo passo
Nesta semana, pegue o último teste que você rodou, ou o que está rodando, e passe pela tabela acima, linha por linha. Se ele falha em qualquer uma, o resultado não vale e a decisão que saiu dele merece revisão. Depois monte o próximo na ordem deste artigo: hipótese com o "porque", custo por resultado como métrica, orçamento igual em cada conjunto e uma semana inteira no calendário sem mexer. Para acompanhar os dois lados por dia sem montar planilha, veja como funciona o relatório de tráfego pago do Vazante.
Perguntas frequentes
Quanto tempo um teste A/B no Meta Ads precisa rodar?
O suficiente para os dois lados acumularem resultados no evento que decide, com a mesma duração e no mesmo período. Uma semana inteira é o mínimo prático na maioria das contas, porque cobre a variação entre dias da semana. Se em uma semana o volume ainda é baixo, estenda os dois lados juntos.
Posso testar criativo e público ao mesmo tempo?
Não, se você quer saber o que causou a diferença. Com duas variáveis mudando, o vencedor pode ter ganhado pelo criativo, pelo público ou pela combinação, e você não tem como separar. Teste uma coisa por vez e encadeie os testes.
Qual métrica decide um teste A/B de anúncio?
A métrica ligada ao objetivo da campanha: custo por resultado, ou custo por lead e custo por compra. CTR e CPC servem para explicar por que um lado ganhou, não para declarar o vencedor. Um anúncio com CTR maior e CPL maior perdeu.
O teste A/B nativo do Meta é melhor do que duplicar conjuntos?
Quando ele está disponível para a variável que você quer testar, sim, porque divide o público sem sobreposição entre os lados. Duplicar conjuntos na mão funciona, mas exige orçamento igual em cada conjunto e cuidado para os dois não disputarem as mesmas pessoas.
O que fazer com o anúncio que perdeu o teste?
Pausar, não excluir. O anúncio pausado guarda o histórico de gasto, resultados e comentários, e você pode voltar nele para comparar ou reaproveitar. Excluir apaga a referência e a próxima pessoa que abrir a conta não vai saber o que já foi testado.