Vazante

Relatórios de Meta Ads

Teste A/B no Meta Ads: como montar um que responda alguma coisa

Teste A/B no Meta Ads só responde quando muda uma variável, tem hipótese escrita e volume suficiente. Veja como montar e o que invalida o teste.

Este artigo também está em: English · Español

Um teste A/B no Meta Ads responde alguma coisa quando cumpre quatro condições, todas antes de ligar: muda uma variável só, tem hipótese escrita, tem a métrica de decisão definida e dá aos dois lados o mesmo tempo, o mesmo período e a mesma chance de gastar. Sem isso, o que sai é dois números diferentes e nenhuma resposta. Este artigo mostra como montar o teste nessa ordem, por que 20 leads contra 23 não diz nada, o que fazer com o perdedor e o erro que invalida a maioria dos testes: rodar dentro de uma campanha com orçamento otimizado que escolhe um lado antes de você.

Uma variável por vez: criativo, público ou página

A regra é simples e é a mais quebrada: o lado A e o lado B diferem em uma coisa só. Criativo, público ou página de destino. Nunca dois ao mesmo tempo.

O motivo não é purismo. Se o anúncio B tem um vídeo novo e um público novo e ganha, você aprendeu que a combinação ganhou. Não sabe se o vídeo teria ganhado no público antigo, nem o contrário. O próximo teste começa do zero, e o anterior custou verba para ensinar algo que não dá para reaproveitar.

Na prática, escolha a variável pela pergunta que você tem:

  • Criativo, quando a dúvida é gancho, formato ou oferta. É o teste mais comum e o que mais muda o custo por resultado.
  • Público, quando o criativo já provou e a dúvida é onde ele escala. Teste um público contra outro com o mesmo anúncio, e não anúncios diferentes em públicos diferentes.
  • Página de destino, quando os cliques chegam e o resultado não. Mesmo anúncio, mesmo público, duas páginas.

Tudo o que não é a variável fica igual: orçamento, posicionamentos, evento de otimização, cronograma. Duas mudanças são dois testes, um depois do outro. A leitura completa da campanha antes de decidir o que testar está em como analisar campanha de Meta Ads.

A hipótese vem escrita antes de ligar

Um teste sem hipótese é curiosidade com orçamento. A hipótese é uma frase, escrita antes de ligar: "acredito que B vai ter custo por lead menor que A porque X". O "porque" é a parte que importa: obriga você a dizer o que espera aprender, e separa um teste de uma tentativa.

Exemplos que funcionam como hipótese:

  • "O vídeo com a dor no primeiro segundo vai ter CPL menor que o vídeo com a marca no primeiro segundo, porque a atenção no feed acaba antes da marca aparecer."
  • "O público amplo vai ter CPL igual ou menor que o interesse específico, porque o sistema de entrega encontra quem converte sem a restrição."
  • "A página com formulário na primeira dobra vai converter mais, porque metade dos cliques vem de celular e não rola."

Escreva também o que vai fazer com cada resultado. Se B ganhar, vira o padrão. Se A ganhar, a ideia é descartada. Se der empate, nada muda. Decidir isso antes evita o teste que "deu empate, mas vou deixar o B porque gostei mais".

A métrica que decide: custo por resultado, não CTR

A métrica que declara o vencedor é a que está ligada ao objetivo da campanha: custo por resultado. Em campanha de leads, custo por lead. Em campanha de vendas, custo por compra ou ROAS. Definida antes de ligar, junto com a hipótese.

CTR, CPC e CPM entram como diagnóstico, não como veredito. Um anúncio com CTR maior e CPL maior perdeu: chamou mais atenção e trouxe cliques que não viraram lead. O CTR explica por que ele perdeu (o gancho atrai gente errada, ou a página não sustenta a promessa) e alimenta o próximo teste. Mas o veredito é o custo por resultado.

O erro é decidir pela métrica que aparece primeiro. CTR aparece no primeiro dia; lead demora. Quem decide pelo CTR no terceiro dia escolhe o anúncio que mais gera clique, não o que mais gera resultado. A cadeia entre CPM, CTR, CPC e custo por resultado está em métricas do Meta Ads.

Volume: por que 20 leads contra 23 não diz nada

Aqui a maioria dos testes morre. A campanha roda cinco dias, A tem 20 leads, B tem 23, e o relatório diz que B venceu por 15%. Não venceu. B teve três leads a mais num volume em que três leads é ruído.

O raciocínio não precisa de fórmula. Lead é um evento que acontece ou não, pessoa por pessoa. Se você rodar o mesmo anúncio, para o mesmo público, em dois conjuntos idênticos, os dois não terminam com o mesmo número de leads. Terminam com números parecidos, e a diferença entre eles é a variação natural: o que muda de um lado para o outro por acaso, sem causa nenhuma. Com 20 leads, essa variação cabe com folga em três leads de diferença.

O teste prático, sem estatística: pergunte quantos leads precisariam trocar de lado para inverter o resultado. Se a resposta é dois ou três, você tem uma amostra pequena, não um resultado. Se é vinte, você tem algo.

Não existe número mínimo universal, e desconfie de quem diz que existe. O que existe é uma relação: quanto menor o volume, maior a diferença que precisa aparecer para ser sinal. Diferença pequena com volume pequeno não vale nunca, e o certo é estender o teste ou aceitar que ele não respondeu.

Mesma duração, mesmo período, mesmo orçamento

Os dois lados rodam ao mesmo tempo, pelo mesmo número de dias, com o mesmo orçamento. Parece óbvio e é onde entra a segunda leva de testes inválidos.

Mesmo período. A na semana 1 e B na semana 2 não é teste, é comparação de semanas. O leilão muda, um concorrente entra, chega um feriado. A diferença entre A e B fica misturada com a diferença entre as semanas.

Mesma duração, e uma semana inteira. Terça é diferente de sábado. Uma semana completa para os dois, do mesmo dia da semana ao mesmo dia da semana, elimina o peso desigual dos dias. Se uma semana não deu volume, estenda os dois juntos, nunca só um.

Mesmo orçamento. Cada lado tem o seu orçamento, e ele é igual. Se A gastou R$ 900 e B gastou R$ 300, B teve um terço da chance de acumular volume, e o volume é o que valida o teste.

Sem mexer no meio. Uma edição relevante em um dos lados reinicia a calibragem do sistema de entrega para aquele lado, e os dois deixam de ser comparáveis. Isso inclui subir a verba do lado que "está indo bem" no terceiro dia. Se precisa mexer, pare, ajuste os dois e recomece a contagem.

O erro que invalida o teste A/B no Meta Ads: orçamento otimizado

Este erro invalida mais testes do que todos os outros juntos, e quase ninguém percebe: montar A e B como dois conjuntos dentro de uma campanha com orçamento otimizado no nível da campanha.

O mecanismo: com orçamento na campanha, o sistema de entrega distribui a verba entre os conjuntos de acordo com o que ele avalia, a cada momento, como o lado mais eficiente. Nas primeiras horas, com pouco dado, ele forma uma preferência e manda a maior parte da verba para um conjunto. O outro recebe migalhas, nunca acumula volume, e no fim você tem um lado com R$ 850 de gasto e outro com R$ 150. O lado que "perdeu" não perdeu: nunca competiu.

A correção é uma das duas:

  1. Orçamento no nível do conjunto, igual nos dois lados, sem otimização de campanha. Cada conjunto gasta o seu e o sistema não escolhe por você.
  2. O recurso de teste A/B do próprio Meta, quando ele está disponível para a variável que você quer testar. Ele divide o público entre os lados sem sobreposição, o que resolve também o problema dos dois conjuntos disputando as mesmas pessoas no leilão.

Se o gasto ficou desigual, não tente corrigir lendo custo por resultado. Refaça.

O que fazer com o perdedor: pausar, não excluir

Terminou o teste, um lado ganhou pela métrica que você definiu, com volume que sustenta a diferença. O que fazer com o outro lado: pausar.

Não excluir. O anúncio ou conjunto pausado guarda tudo: gasto, resultados, quebra por dia, comentários, a data em que rodou. Isso é o histórico da conta, e histórico é o que impede a mesma ideia de ser testada três vezes por três pessoas diferentes. Quem assume a conta daqui a seis meses abre a lista de pausados e vê o que já foi tentado.

Registre fora do Gerenciador também: uma linha por teste, com hipótese, variável, período, gasto e resultado por lado, vencedor e decisão. Uma planilha simples serve. Confiar na memória não serve.

E não tire o vencedor da rotina de observação. Se a frequência sobe e o CTR cai nas semanas seguintes, ele está saturando, e o próximo teste é contra ele.

Um exemplo para mostrar a conta

Números inventados só para mostrar a conta. Campanha de leads, teste de criativo, R$ 120 por dia em cada conjunto, uma semana.

Criativo ACriativo B
Gasto (7 dias)R$ 840R$ 840
Leads2023
CPLR$ 42,00R$ 36,52
CTR no link1,1%1,4%

B tem CPL 13% menor e CTR maior. A tentação é declarar vencedor. Aplique o teste dos leads que trocam de lado: se dois leads saíssem de B e entrassem em A, A teria 22 (R$ 38,18) e B teria 21 (R$ 40,00). Inverte com dois leads. Não há resposta ainda.

O teste segue por mais duas semanas, os dois lados juntos, sem edição:

Criativo ACriativo B
Gasto (21 dias)R$ 2.520R$ 2.520
Leads6184
CPLR$ 41,31R$ 30,00

Agora B tem CPL 27% menor, e seriam necessários mais de dez leads trocando de lado para inverter. A hipótese se sustenta, B vira o padrão, A é pausado com o histórico intacto e o próximo teste parte de B. O CTR ficou de fora da decisão: ele explica, não decide.

Erro comum, por que invalida e a correção

Erro comumPor que invalida o testeCorreção
Criativo e público mudam juntosNão dá para saber qual dos dois causou a diferençaUma variável por teste; encadear os testes
Sem hipótese escritaQualquer resultado vira "interessante" e nada mudaUma frase com "porque" antes de ligar, e a decisão para cada desfecho
Decidir pelo CTRCTR chega primeiro e mede atenção, não resultadoCusto por resultado definido antes; CTR como diagnóstico
20 leads contra 23A diferença cabe na variação naturalEstender os dois lados até a diferença não inverter com poucos leads
A numa semana, B na outraA diferença entre as semanas se mistura com a diferença entre os ladosMesmo período, mesma duração, semana inteira
Orçamento otimizado na campanhaO sistema escolhe um lado nas primeiras horas e o outro nunca competeOrçamento igual por conjunto, ou o teste A/B nativo
Subir verba do lado que "está indo bem"Reinicia a calibragem de um lado e desiguala o gastoNão editar durante o teste; se precisar, recomeçar os dois
Excluir o perdedorApaga o histórico e o mesmo teste volta a ser feitoPausar e registrar em uma linha fora do Gerenciador

Próximo passo

Nesta semana, pegue o último teste que você rodou, ou o que está rodando, e passe pela tabela acima, linha por linha. Se ele falha em qualquer uma, o resultado não vale e a decisão que saiu dele merece revisão. Depois monte o próximo na ordem deste artigo: hipótese com o "porque", custo por resultado como métrica, orçamento igual em cada conjunto e uma semana inteira no calendário sem mexer. Para acompanhar os dois lados por dia sem montar planilha, veja como funciona o relatório de tráfego pago do Vazante.

Perguntas frequentes

Quanto tempo um teste A/B no Meta Ads precisa rodar?

O suficiente para os dois lados acumularem resultados no evento que decide, com a mesma duração e no mesmo período. Uma semana inteira é o mínimo prático na maioria das contas, porque cobre a variação entre dias da semana. Se em uma semana o volume ainda é baixo, estenda os dois lados juntos.

Posso testar criativo e público ao mesmo tempo?

Não, se você quer saber o que causou a diferença. Com duas variáveis mudando, o vencedor pode ter ganhado pelo criativo, pelo público ou pela combinação, e você não tem como separar. Teste uma coisa por vez e encadeie os testes.

Qual métrica decide um teste A/B de anúncio?

A métrica ligada ao objetivo da campanha: custo por resultado, ou custo por lead e custo por compra. CTR e CPC servem para explicar por que um lado ganhou, não para declarar o vencedor. Um anúncio com CTR maior e CPL maior perdeu.

O teste A/B nativo do Meta é melhor do que duplicar conjuntos?

Quando ele está disponível para a variável que você quer testar, sim, porque divide o público sem sobreposição entre os lados. Duplicar conjuntos na mão funciona, mas exige orçamento igual em cada conjunto e cuidado para os dois não disputarem as mesmas pessoas.

O que fazer com o anúncio que perdeu o teste?

Pausar, não excluir. O anúncio pausado guarda o histórico de gasto, resultados e comentários, e você pode voltar nele para comparar ou reaproveitar. Excluir apaga a referência e a próxima pessoa que abrir a conta não vai saber o que já foi testado.

Leia também