A maioria dos produtos que colocam um modelo por trás de uma interface de chat em 2026 buscam o modelo de fronteira mais inteligente disponível. A Cambio roda em Gemini 2.5 Flash Lite. Aqui está a troca de engenharia real que levou a essa escolha — incluindo o período que passamos em outro modelo de nível rápido primeiro — e as condições que nos fariam mudar de ideia novamente.
Quando você decide colocar um modelo de linguagem por trás de uma superfície de produto em 2026, o padrão mais alto é usar o modelo de fronteira que tiver a maior pontuação no leaderboard do mês. Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra — esses são os nomes que surgem quando as equipes de produto discutem "qual IA". Mais inteligente é melhor, o raciocínio segue, e a diferença de custo desaparece em escala.
A Cambio roda em Gemini 2.5 Flash Lite. Não a variante de raciocínio, não a variante de fronteira — o menor modelo de nível rápido que o Google envia, situado abaixo do Flash e bem abaixo do Pro. Tomamos essa decisão deliberadamente, após avaliar as alternativas óbvias e executar um modelo de nível rápido anterior (grok-4-1-fast da xAI) em produção por várias semanas. Este post é o raciocínio de engenharia real por trás da escolha atual, as condições que a impulsionaram e as condições que nos fariam revisitar novamente.
O que o modelo tem que fazer na Cambio
Dois trabalhos, ambos limitados. Nenhum deles exige muito raciocínio.
O primeiro é a análise. O modelo recebe uma mensagem curta do usuário — tipicamente de 5 a 30 palavras — e extrai campos estruturados: categoria (Swap, Execute, Suggest, Compare, Help, Explore), moeda-de, rede-de, moeda-para, rede-para, valor, direção. A maioria dos casos é tratada por uma camada de regex que roda sem o modelo. O modelo é invocado quando o regex é incerto. A saída é um objeto JSON com no máximo sete campos.
A segunda é a narração. O modelo recebe um objeto estruturado da cotação e produz uma explicação curta em linguagem simples. Ele não pode escrever um preço, uma taxa de câmbio ou um valor; todos os números ficam no card da cotação. A saída tem uma ou duas frases curtas, nunca mais de 40 palavras.
Nenhum dos trabalhos envolve raciocínio multi-etapas. Nenhum trabalho exige que o modelo escolha entre muitas alternativas. Nenhum trabalho tem o modelo interagindo com ferramentas, chamando APIs ou mantendo estado entre turnos. Os requisitos de capacidade são: ler um prompt curto, seguir um formato de saída estruturado, produzir inglês coerente. Todo modelo de linguagem moderno pode fazer isso, incluindo os lançados há dois ou três anos.
Por que modelos de raciocínio de fronteira são a ferramenta errada aqui
Quando comparamos os candidatos, executamos lotes de avaliação idênticos contra Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra e Gemini 2.5 Flash Lite. O teto de capacidade para correção de análise e qualidade de narração atingiu o pico em torno de 99.4-99.6% em todos os modelos. Os modelos de fronteira obtiveram pontuações marginalmente mais altas nos prompts mais ambíguos — o tipo onde a mensagem é genuinamente incerta — mas o ganho marginal foi de alguns décimos de por cento em uma carga de trabalho que já tinha um pré-filtro de regex lidando com os 95% fáceis.
O quadro de custos foi menos marginal. Por milhão de tokens, os modelos de raciocínio de fronteira em 2026 são precificados aproximadamente 8x a 20x as variantes rápidas. O quadro de latência foi ainda menos marginal. A latência do primeiro token P95 no Claude Opus está na faixa de 800-1500 ms; no GPT-5 é 600-1100 ms; no Gemini 2.5 Flash Lite é 120-300 ms. Para um produto onde a viagem completa do composer deve ser inferior a 200 milissegundos, um modelo que leva 600 ms para iniciar seu primeiro token é estruturalmente incompatível.
Uma taxa de análise de 99.5% a 200 ms é um produto melhor do que uma taxa de análise de 99.7% a 800 ms. A curva de experiência do usuário é dominada pela latência na faixa em que operamos. Uma vez que o modelo é rápido o suficiente e certo o suficiente, mais "inteligência" é orçamento desperdiçado.
Por que o nível rápido em geral
A lista de modelos viáveis para os trabalhos da Cambio vem do nível rápido entre os provedores: Claude Haiku 4.5, GPT-5 Mini, Gemini 2.5 Flash Lite, grok-4-1-fast. Todos os quatro são capazes o suficiente nos benchmarks de análise e narração. Todos os quatro são rápidos o suficiente para se encaixar em nosso orçamento de latência. Todos os quatro são baratos o suficiente para que o custo por cotação seja insignificante em nosso volume de lançamento.
Nesse ponto, a decisão é menos sobre a capacidade do modelo e mais sobre o ajuste operacional. Avaliamos quatro eixos: custo por cotação no volume de lançamento, confiabilidade da saída estruturada, latência sob carga realista do provedor e a saúde prática do SDK do provedor e postura de limite de taxa.
Por que Gemini 2.5 Flash Lite especificamente
Sobre custo: Flash Lite é o mais barato dos quatro em nossa mistura específica de tokens de entrada/saída. As chamadas de análise da Cambio são de entrada curta, saída curta, e o preço por milhão do Flash Lite nesse padrão simétrico curto/curto superou Haiku, GPT-5 Mini e grok-4-1-fast em ~20–60% no nível por chamada. No volume de lançamento, a diferença absoluta é de poucos dólares por dia entre os quatro; no volume projetado pós-lançamento, a lacuna é significativa.
Sobre confiabilidade da saída estruturada: o modo JSON `responseSchema` do Google é o mais disciplinado dos quatro. Medimos com que frequência cada modelo retornava um objeto JSON analisável que correspondia ao nosso esquema na primeira tentativa para nosso template de prompt exato. Flash Lite empatou com Haiku no topo (>99.5%); grok-4-1-fast ficou logo atrás (~99.3%); GPT-5 Mini ficou para trás (~97.8%). A diferença de 1.7 pontos percentuais entre o topo e o fundo é dinheiro real — cada saída malformada é uma nova tentativa, o que dobra a latência para esse usuário.
Sobre latência sob carga do provedor: o Google tem a maior pegada de serviço de qualquer um dos quatro provedores. A latência do primeiro token P99 no Flash Lite permaneceu abaixo de 350 ms durante o horário comercial dos EUA em nossos testes de carga, sem contenção de fila mensurável. Os outros três provedores mostraram picos frios de 5–15 segundos durante janelas de alto tráfego nos últimos seis meses. Não estamos argumentando que os modelos subjacentes são mais lentos; estamos argumentando que a postura de contenção é materialmente melhor na infraestrutura do Google.
Sobre a execução anterior em produção: enviamos a primeira versão da Cambio em grok-4-1-fast e a executamos por várias semanas. Funcionou. A mudança para Flash Lite (commit em 2026-05-27) não foi porque Grok estava errado — foi porque Gemini era mensuravelmente melhor nos quatro eixos acima quando reexecutamos o conjunto de avaliação. A camada de agente é independente do provedor: xAI e OpenAI ainda são selecionáveis atrás de um sinalizador de configuração, e o harness de teste continua a stubar todos eles. Se Gemini regredir, podemos voltar com uma única alteração de configuração.
Por que não a variante de raciocínio
Gemini 2.5 lança uma variante com modo de pensamento. Nós não o usamos. O modo de pensamento é projetado para problemas que se beneficiam de cadeia de pensamento — problemas de múltiplos passos, problemas onde o modelo tem que considerar alternativas, problemas onde passos intermediários de rascunho melhoram a resposta final.
Nenhum dos nossos dois trabalhos é assim. Analisar uma curta mensagem do usuário em sete campos estruturados não se beneficia de um passo de raciocínio. Narrar um objeto de cota estruturado em uma explicação de uma frase não se beneficia de um passo de raciocínio. O modo de pensamento adicionaria 300-800 ms de latência para uma melhoria de qualidade que não podemos medir. Testamos ambos. A saída sem pensamento era indistinguível em qualidade e ~3x mais rápida.
Nossas notas internas fixam essa preferência explicitamente. A produção executa `gemini-2.5-flash-lite` com o pensamento desativado; desenvolvimento e teste sempre simulam o LLM inteiramente via `AGENT_STUB_LLM=true` para que o harness nunca cobre tokens. O padrão foi adicionado após uma versão inicial do assistente ser acidentalmente apontada para uma variante de modo de pensamento e a latência no composer dobrar da noite para o dia. A correção foi uma mudança de configuração de uma linha. A lição é duradoura: para nossos trabalhos, o raciocínio é sobrecarga.
O que estamos abrindo mão
Divulgação honesta do trade-off. Ao não usar um modelo de ponta, estamos abrindo mão da capacidade marginal nos prompts mais ambíguos. Um usuário que digita algo genuinamente confuso no composer pode obter uma pergunta de esclarecimento ligeiramente pior do que obteria do GPT-5. Também estamos abrindo mão do acesso a certos recursos avançados que o nível de ponta oferece — janelas de contexto de um milhão de tokens, cadeias complexas de chamadas de ferramentas, raciocínio multimodal profundo — nenhum dos quais importa para nossos trabalhos, mas que importaria se expandíssemos o escopo do modelo. (Não faremos isso, de acordo com a postagem anterior desta série.)
The trade-offs we are not making: we are not giving up parse correctness on the common case, we are not giving up narration quality, we are not giving up latency, we are not giving up cost predictability. The 0.2-0.5 percentage points of marginal capability we lose to choosing a fast model over a frontier one is a price we are happy to pay.
Quando revisaríamos
Algumas condições específicas nos fariam reabrir a seleção do modelo novamente.
Se a latência do Flash Lite degradar materialmente — digamos, p95 subir acima de 600 ms durante o horário de pico e permanecer lá por mais de uma semana — o orçamento de latência quebra e mudamos. Nosso harness de avaliação executa continuamente contra todos os quatro modelos pré-selecionados com nosso template de prompt exato, então temos números atuais o tempo todo.
Se adicionarmos suporte multilíngue e a qualidade do Flash Lite cair mais do que os outros modelos de nível rápido nos idiomas específicos que adicionarmos (espanhol, russo, chinês são os primeiros), podemos ir para múltiplos provedores — Gemini para o caminho principal em inglês e um modelo diferente para idiomas onde ele tem desempenho inferior. A camada do agente já suporta esse roteamento.
Se os preços mudarem substancialmente — digamos, o Google aumentar as taxas do Flash Lite em 5x ou um concorrente cortar para um décimo — revisamos o eixo de custo. Não mudaremos por uma diferença de preço de 10%, mas uma mudança estrutural importa.
Se um novo modelo de outro provedor superar claramente o Flash Lite em nosso conjunto de avaliação específico (o benchmark de análise e o benchmark de narração em nossos prompts de produção reais, não em leaderboards genéricos), mudamos. Executamos o conjunto de avaliação mensalmente. Na última vez que fizemos isso, o Flash Lite venceu todas as células relevantes — que é como acabamos aqui em primeiro lugar.
A lição geral
Escolher um modelo é uma decisão específica da carga de trabalho, não uma decisão de marca. O "melhor" modelo para um produto depende da forma dos prompts que você está enviando, do orçamento de latência que você tem, da disciplina de saída estruturada que você precisa, do envelope de custo na sua escala e da postura do provedor com a qual você pode conviver. Nenhuma dessas coisas é visível em um leaderboard. Todas elas têm que ser medidas contra sua carga de trabalho real — e reavaliadas periodicamente, porque os provedores lançam novos modelos de nível rápido a cada poucos meses e a resposta pode mudar.
Para a forma da Cambio — prompts curtos e simétricos, orçamento de latência rígido, dois trabalhos estreitos que não precisam de raciocínio — Gemini 2.5 Flash Lite é a resposta certa hoje. Para um produto diferente com uma forma diferente, a resposta certa é genuinamente diferente. Se você está construindo algo semelhante, a conclusão não é "use Gemini Flash Lite". É "construa uma camada de agente independente do provedor, teste o nível rápido contra sua carga de trabalho real e execute o teste a cada trimestre".
O último post desta série vai mais fundo do que qualquer outro até aqui: como as trocas entre redes funcionam na Cambio sem contratos de bridge, e por que esse é um perfil operacional diferente das arquiteturas que boa parte do setor usa para a mesma tarefa.



