Modelo de IA e BYOK
Esta página explica qual modelo de IA impulsiona seu bot, por que apenas um provedor é suportado para BYOK (Bring Your Own Key - Traga sua própria chave) e como configurar sua própria chave, caso seu plano inclua isso.
Qual modelo de IA impulsiona o bot
A plataforma utiliza o Anthropic Claude como modelo principal para o seu bot. O Claude foi escolhido porque, após testes extensivos em todos os principais modelos de fronteira (termo da indústria para os modelos de IA mais avançados disponíveis) no mercado, é o único que lida com o volume de mensagens de produção de forma confiável.
Você não precisa escolher um modelo. A plataforma seleciona automaticamente o modelo certo para cada tarefa e otimiza como ele é usado nos bastidores (incluindo cache de prompt avançado, o que reduz drasticamente o custo por conversa).
Por que apenas Anthropic para BYOK
Os clientes frequentemente perguntam se adicionaremos suporte para OpenAI, Google Gemini, OpenRouter ou modelos de código aberto para BYOK. A resposta honesta é: nenhum deles, usados de forma bruta e não otimizada, aguenta o volume de produção.
Para um projeto pequeno, uma taxa de sucesso de 9 em 10 de uma IA é aceitável. Quando você está conduzindo conversas reais com clientes em escala, uma taxa de falha de 10% significa agendamentos interrompidos, respostas erradas, acompanhamentos perdidos e vendas perdidas. Isso está na faixa do que vemos até mesmo em modelos de fronteira de alto nível de outros provedores (aproximadamente 6–10% em casos extremos adversários, ou seja, perguntas de teste complicadas e deliberadamente difíceis) — e isso antes de considerar os modelos mais baratos.
Os problemas se dividem em três categorias:
- Casos extremos falham de forma imprevisível. Um modelo pode funcionar perfeitamente por centenas de chats e, de repente, alucinar uma chamada de ferramenta, afirmar que fez algo que não fez ou descartar instruções no meio da conversa.
- Contexto longo é mal gerenciado. Uma única resposta do bot utiliza histórico de chat, FAQs, lógica de acompanhamento, chamadas de ferramentas e raciocínio. A maioria dos modelos trava com esse volume e produz resultados piores.
- “Mais barato” raramente é. O preço de etiqueta mais baixo por token é compensado por mais tentativas, mais tokens de saída e pior conversão. O custo real por conversa bem-sucedida acaba sendo maior.
Suportar 100 modelos diferentes é mais uma estratégia de marketing do que uma capacidade real. Preferimos oferecer a você um provedor que funcione de forma confiável do que cinco que falham de maneiras diferentes.
Nosso Próprio Modelo: Max
Nós construímos nosso próprio modelo interno, Max — um modelo interno somado a uma pilha de otimização de múltiplas passagens, refinado com dados de conversas reais da plataforma. O objetivo era um modelo significativamente mais econômico que o Claude, mantendo a confiabilidade nos padrões de conversa que a plataforma realmente executa, e é isso que o Max entrega: uma fração do preço do Pro (0,25 créditos por ação), ajustado para manter a precisão onde um modelo de orçamento básico falha.
O Max não precisa de configuração — sem escolha de modelo, sem conta de provedor, sem chave. Ele é executado inteiramente em nossa infraestrutura e é o modelo mais preciso que oferecemos: em nossos próprios benchmarks, ele é o mais forte em manter-se fiel ao que sua empresa realmente diz. Para uma análise completa de como o Max se compara ao Claude e aos modelos de terceiros de baixo custo sobre os quais os clientes frequentemente perguntam — incluindo o que esses modelos realmente erraram em nossos testes — veja Por que o Max é o melhor custo-benefício.
Quem vê o nível Max
Se o seletor de Qualidade de IA na aba Instruções de IA do seu Agente mostra apenas Pro e Economy, o Max simplesmente não está ativado para a conta em que você está logado. Duas coisas o ativam:
- Contas em um plano vitalício elegível recebem o Max automaticamente.
- Qualquer outra conta precisa que o Max seja ativado explicitamente nela.
Em uma conta fornecida por uma agência, seu provedor pode ter escolhido o modelo para você. Se o seletor de Qualidade de IA mostrar apenas um cartão e não houver nada para alternar, essa é uma configuração deliberada em sua conta, não uma falha — peça a quem fornece sua conta para alterá-la. Se um cartão ainda for exibido com uma observação de que não está mais disponível, seu Agente está em um modelo que seu provedor removeu desde então: ele continua respondendo, mas em um dos modelos que eles permitem, então escolha um deles para fazer com que o seletor corresponda ao que realmente está sendo executado.
Conectar sua própria chave da Anthropic (BYOK) não tem nada a ver com a visibilidade do Max. Os dois funcionam lado a lado — veja a nota de exceção em Configurando BYOK para saber como um Agente Max é cobrado quando você tem uma chave conectada. Remover sua chave de API não fará o Max aparecer.
O nível Mini
Se você pode ver o Max, você também pode ver o Mini, por 0,15 créditos por ação. O Mini é a mesma IA que o Max a um preço menor, com duas compensações:
- Uma chance maior de erros. O Mini é o modelo mais leve dos dois. O Max é o modelo mais preciso que oferecemos — ajustado rigorosamente para se manter fiel ao que sua empresa realmente diz —, enquanto com o Mini há uma chance maior de um pequeno erro ou alucinação aparecer em uma resposta.
- Memória mais leve. Em conversas longas, o Mini se lembra de menos mensagens antigas e utiliza menos trechos da base de conhecimento por resposta.
O Max continua sendo a escolha recomendada para qualquer situação em que um detalhe incorreto possa custar uma venda — agendamentos, perguntas sobre preços, suporte com riscos reais. O Mini se encaixa em conversas de alto volume e sensíveis ao preço, onde a velocidade e o custo importam mais do que o último percentual de precisão.
O Mini fica no mesmo seletor de Qualidade de IA que o Max, em todas as contas que possuem o Max. Assim como o Max, o Mini é executado inteiramente em nossa infraestrutura e nunca usa uma chave BYOK, portanto, uma chave Anthropic conectada não é usada (e não é cobrada) enquanto um Agente estiver no Mini.
O que a taxa do Mini de 0,15 cobre. O preço do Mini aplica-se a tudo o que acontece dentro de uma conversa ao vivo: respostas de IA, chamadas de ferramentas de IA (como agendar um compromisso ou alertar um humano), avaliações de chat (decidir se uma conversa deve ser ignorada ou encerrada), tratamento de interrupções (quando um contato envia uma nova mensagem enquanto o bot ainda está compondo sua resposta), resumos de chat e marcação automática por IA. Recursos de IA pontuais fora da conversa — otimização de campanhas, geração de base de conhecimento e marcação feita via API — têm uma taxa fixa única de 0,25 créditos tanto no Max quanto no Mini, portanto, você pode ver entradas ocasionais de 0,25 no seu histórico de créditos mesmo quando todos os Agentes estão configurados para o Mini. Esses são esses recursos, não o modelo Max respondendo aos seus chats.
Configurando o BYOK
O BYOK está incluído nos planos Agency e Agency Unlimited, e nos níveis vitalícios do AppSumo a partir do Plan 2. Ele não faz parte do plano Business. Se o seu plano o incluir, você pode conectar sua própria chave de API da Anthropic (um código privado da sua conta Anthropic que permite que a plataforma cobre o uso de IA diretamente de você, em vez de usar os créditos da plataforma).
Apenas chaves oficiais da Anthropic funcionam. Uma chave válida vem da sua própria conta em console.anthropic.com e sempre começa com
sk-ant-. Chaves de revendedores, proxies ou sites de “API Claude com desconto” (que geralmente começam com um prefixo diferente) não são suportadas e não serão salvas. Tenha cuidado com ofertas de tokens Claude baratos muito abaixo dos preços da própria Anthropic — ninguém pode revender legitimamente o acesso ao Claude abaixo do que a Anthropic cobra, e essas ofertas são quase sempre golpes baseados em chaves roubadas ou configuradas para obter seus dados de pagamento por phishing.
Está no celular? A barra lateral esquerda pode estar oculta. Toque no ícone de menu (☰) primeiro e, em seguida, toque em Configurações.
Não vê as Chaves de API BYOK no grupo Avançado? A seção só aparece em planos que incluem BYOK. Se sua conta é gerenciada por um provedor, ela aparece apenas quando eles ativam o Trazer Sua Própria Chave de API para sua conta.
- Na barra lateral esquerda principal, clique em Configurações (o ícone de engrenagem próximo à parte inferior).
- Na página de Configurações, no menu à esquerda, role até o grupo Avançado.
- Clique em Chaves de API BYOK.
- Clique em Add key no cartão da Anthropic. Um campo Secret key aparecerá (placeholder
sk-ant-…).
- Cole sua chave de API da Anthropic no campo e clique em Save key.
Uma vez ativado, seu bot usará sua própria chave para chamadas de IA, e você pagará à Anthropic diretamente por esse uso em vez de gastar créditos da plataforma em respostas de IA. A infraestrutura do canal (servidores do WhatsApp Web, números de telefone, etc.) continua usando créditos normalmente.
Uma exceção — o nível Max. Se a Qualidade de IA de um Agente estiver definida para o nível Max, esse Agente roda inteiramente em nossa infraestrutura interna e é cobrado a 0,25 créditos por ação, mesmo quando você tem BYOK conectado — o Max nunca usa sua chave da Anthropic. (O mesmo se aplica ao Mini, onde disponível: 0,15 créditos por ação, nunca sua chave.) Para cobrar as respostas em sua própria conta da Anthropic, mantenha o Agente no nível Pro (padrão). O seletor de Qualidade de IA fica na aba Instruções de IA de cada Agente. A página de configurações de Chaves de API BYOK mostra um aviso sempre que sua chave está registrada, mas um ou mais de seus Agentes ainda estão rodando no nível Max, listando quais são — para que você possa identificar rapidamente por que créditos ainda estão sendo usados.
Uma observação sobre custos: Trazer sua própria chave não é mais a opção barata. Com uma chave conectada, seu Agente é executado no Claude e você paga as taxas medidas da Anthropic diretamente (a Anthropic cobra com base no quanto você realmente usa, de forma semelhante a uma conta de serviços públicos). Medido nas contas que usam sua própria chave, uma resposta de IA custa aproximadamente 3 vezes o que a mesma resposta custa no Max e mais de 5 vezes o que custa no Mini, ao contabilizar o trabalho de segundo plano que uma resposta aciona (consulta à base de conhecimento, verificação de spam, extração de nome e e-mail, avaliações de chat, marcação), tudo isso incluído na taxa fixa do Max e do Mini, mas cobrado por token na sua chave. Nossas otimizações de cache de prompt também se aplicam à sua própria chave, portanto, não se trata de uma lacuna de cache; Max e Mini são simplesmente modelos muito mais baratos que também pontuam melhor em nosso benchmark de conversas de vendas. Use BYOK quando você quiser especificamente que o uso da IA seja cobrado em sua própria conta da Anthropic, não para economizar dinheiro.
Por que a primeira resposta em uma conversa custa muito mais do que as restantes. O cache funciona armazenando o contexto da conversa com a Anthropic na primeira vez que é enviado e, em seguida, reutilizando-o. Escrevê-lo custa mais do que uma solicitação normal; cada resposta que o reutiliza custa aproximadamente um vigésimo do valor. Portanto, a primeira resposta parece alarmantemente cara e as que vêm depois dela são muito baratas. Qualquer coisa grande na conversa torna essa primeira resposta maior — um documento que um visitante envia é o principal exemplo. Um PDF de 24 páginas resulta em cerca de 70.000 tokens, porque cada página é enviada tanto como texto quanto como uma imagem da página, e ele permanece na conversa, então é reenviado (e re-armazenado em cache) a cada resposta. Se uma conversa ficar inativa por mais de uma hora, a cópia armazenada expira e a próxima resposta paga a gravação novamente.
Se você está criando algo que envolve muitos documentos — explicadores de contratos, consultas de manuais, qualquer coisa em que as pessoas façam upload de arquivos — o nível Max geralmente é a melhor opção: é uma taxa fixa de 0,25 créditos por resposta, não importa o tamanho do documento, portanto, não há pico na primeira mensagem e nenhuma exposição por token. Veja Por que o Max é o melhor custo-benefício para saber como o Max se compara em qualidade e custo.
Se sua chave BYOK falhar (inválida, sem cota ou com limite de taxa — o que significa que a Anthropic limitou temporariamente quantas solicitações sua chave pode fazer), se o seu bot continuará funcionando depende da alternância “Fallback para créditos” na mesma página de Chaves de API BYOK:
- Ligado: a plataforma recorre temporariamente aos créditos da plataforma para que seu bot continue respondendo, e continua tentando usar sua chave em segundo plano — no momento em que uma chamada for bem-sucedida novamente, ele alterna automaticamente de volta para sua própria chave.
- Desligado (o padrão): as respostas de IA são bloqueadas até que você corrija a chave. Nada consome seus créditos silenciosamente, mas seu bot também para de responder; portanto, se você preferir que ele continue usando créditos enquanto resolve o problema da chave, ative essa alternância com antecedência.
De qualquer forma, você receberá um e-mail na primeira vez que sua chave falhar (não um por mensagem).
Perguntas Frequentes
Posso usar OpenAI, Gemini ou outro provedor para BYOK? Não atualmente, para outros provedores. Para a maioria das pessoas, a resposta já está aqui: Max e Mini são nossos próprios níveis internos, a 0,25 e 0,15 créditos por ação.
Minha chave BYOK será usada para tudo? A maioria das operações de IA é isenta de cobrança de créditos quando sua própria chave da Anthropic (BYOK) está conectada: respostas de IA, uso de ferramentas, otimização de campanhas, geração de base de conhecimento e pesquisa na web, tudo é executado usando sua chave. Quatro coisas ainda custam créditos mesmo com uma chave conectada: o nível Max a 0,25 créditos por ação e o nível Mini a 0,15, porque ambos são executados em nossos próprios modelos; o Lead Finder a 0,25 por endereço de e-mail encontrado; e as Automações a 0,25 por execução mais 0,25 por etapa de IA. Para manter um Agente totalmente em sua própria chave a 0 créditos, deixe-o no nível Pro. As taxas de canal (taxa mensal do WhatsApp Web, entrega de mensagens do WhatsApp e taxas de modelo) são cobradas separadamente do uso de IA de qualquer maneira. Se a chave falhar em uma chamada que teria sido executada nela, se a plataforma recorrer aos créditos depende do seu botão Fallback to credits (Recorrer a créditos) — veja o botão “Fallback to credits” descrito acima nesta página.
Quando exatamente as respostas de IA custam 0 créditos? O BYOK é por conta. As respostas de IA custam 0 créditos apenas quando esta conta conectou sua própria chave da Anthropic. Sem sua própria chave, as respostas consomem créditos na taxa normal.
O BYOK afeta a entrega de mensagens ou a confiabilidade do canal? Não. O BYOK altera apenas como as chamadas de IA do seu bot são cobradas. Todo o resto — roteamento de mensagens, infraestrutura de canal, acompanhamentos, campanhas e Transmissões — funciona exatamente da mesma maneira.
Veja também: Por que o Max é o melhor custo-benefício · Configurando seu Bot de IA · Agentes de IA