La mayoría de los productos que ponen un modelo detrás de una interfaz de chat en 2026 recurren al modelo de frontera más inteligente disponible. Cambio se ejecuta en Gemini 2.5 Flash Lite. Aquí está la compensación de ingeniería real que llevó a esa elección — incluido el período que pasamos en un modelo de nivel rápido diferente primero — y las condiciones que nos harían cambiar de opinión nuevamente.
Cuando decides poner un modelo de lenguaje detrás de una interfaz de producto en 2026, la opción predeterminada más ruidosa es usar el modelo de frontera que tenga la puntuación más alta en la tabla de clasificación del mes. Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra — estos son los nombres que surgen cuando los equipos de producto discuten "qué IA". Más inteligente es mejor, razona el argumento, y la diferencia de costo desaparece a escala.
Cambio se ejecuta en Gemini 2.5 Flash Lite. No la variante de razonamiento, no la variante de frontera — el modelo de nivel rápido más pequeño que Google envía, debajo de Flash y muy por debajo de Pro. Tomamos esa decisión deliberadamente, después de evaluar las alternativas obvias y ejecutar un modelo de nivel rápido anterior (grok-4-1-fast de xAI) en producción durante varias semanas. Esta publicación es el razonamiento de ingeniería real detrás de la elección actual, las condiciones que la impulsaron y las condiciones que nos harían revisarla nuevamente.
Lo que el modelo tiene que hacer en Cambio
Dos trabajos, ambos acotados. Ninguno requiere mucho razonamiento.
El primero es el análisis. El modelo toma un mensaje corto del usuario — típicamente de 5 a 30 palabras — y extrae campos estructurados: categoría (Swap, Execute, Suggest, Compare, Help, Explore), moneda de origen, red de origen, moneda de destino, red de destino, cantidad, dirección. La mayoría de los casos son manejados por una capa de expresiones regulares que se ejecuta sin el modelo. El modelo se invoca cuando la expresión regular no está segura. La salida es un objeto JSON con un máximo de siete campos.
La segunda es la narración. El modelo recibe un objeto de cotización estructurado y produce una breve explicación en lenguaje sencillo. No puede escribir un precio, una tasa ni un monto; la tarjeta de cotización lleva cada número. El resultado son una o dos frases cortas, nunca más de 40 palabras.
Ninguno de los trabajos implica razonamiento de varios pasos. Ninguno de los trabajos requiere que el modelo elija entre muchas alternativas. Ninguno de los trabajos tiene al modelo interactuando con herramientas, llamando a APIs o manteniendo estado entre turnos. Los requisitos de capacidad son: leer un prompt corto, seguir un formato de salida estructurado, producir inglés coherente. Todos los modelos de lenguaje modernos pueden hacer esto, incluidos los lanzados hace dos o tres años.
Por qué los modelos de razonamiento de frontera son la herramienta incorrecta aquí
Cuando evaluamos los candidatos, ejecutamos lotes de evaluación idénticos contra Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra y Gemini 2.5 Flash Lite. El techo de capacidad en la corrección del análisis y la calidad de la narración se maximizó alrededor del 99.4-99.6% en cada modelo. Los modelos de frontera obtuvieron puntuaciones marginalmente más altas en los prompts más ambiguos — el tipo donde el mensaje es genuinamente poco claro — pero la ganancia marginal fue de unas pocas décimas de un porcentaje en una carga de trabajo que ya tenía un prefiltro de expresiones regulares manejando el 95% fácil.
El panorama de costos fue menos marginal. Por millón de tokens, los modelos de razonamiento de frontera en 2026 tienen un precio aproximadamente 8x a 20x superior al de las variantes rápidas. El panorama de latencia fue aún menos marginal. La latencia del primer token P95 en Claude Opus está en el rango de 800-1500 ms; en GPT-5 es de 600-1100 ms; en Gemini 2.5 Flash Lite es de 120-300 ms. Para un producto donde la ronda completa del composer debe ser inferior a 200 milisegundos, un modelo que tarda 600 ms en iniciar su primer token es estructuralmente incompatible.
Una tasa de análisis del 99.5% a 200 ms es un mejor producto que una tasa de análisis del 99.7% a 800 ms. La curva de experiencia del usuario está dominada por la latencia en el rango en el que operamos. Una vez que el modelo es lo suficientemente rápido y lo suficientemente correcto, más "inteligencia" es presupuesto desperdiciado.
Por qué el nivel rápido en general
La lista corta de modelos viables para los trabajos de Cambio proviene del nivel rápido entre proveedores: Claude Haiku 4.5, GPT-5 Mini, Gemini 2.5 Flash Lite, grok-4-1-fast. Los cuatro son lo suficientemente capaces en los benchmarks de análisis y narración. Los cuatro son lo suficientemente rápidos para encajar en nuestro presupuesto de latencia. Los cuatro son lo suficientemente baratos como para que el costo por cotización sea insignificante a nuestro volumen de lanzamiento.
En ese punto, la decisión es menos sobre la capacidad del modelo y más sobre el ajuste operativo. Evaluamos cuatro ejes: costo por cotización a volumen de lanzamiento, confiabilidad de salida estructurada, latencia bajo carga realista del proveedor y la salud práctica del SDK del proveedor y la postura de límite de tasa.
Por qué Gemini 2.5 Flash Lite específicamente
En cuanto al costo: Flash Lite es el más barato de los cuatro en nuestra combinación específica de tokens de entrada/salida. Las llamadas de análisis de Cambio son de entrada corta, salida corta, y el precio por millón de Flash Lite en este patrón simétrico corto/corto superó a Haiku, GPT-5 Mini y grok-4-1-fast en un ~20–60% a nivel de llamada. A volumen de lanzamiento, la diferencia absoluta es de unos pocos dólares por día entre los cuatro; a volumen proyectado post-lanzamiento, la brecha es significativa.
En cuanto a la confiabilidad de salida estructurada: el modo JSON `responseSchema` de Google es el más disciplinado de los cuatro. Medimos con qué frecuencia cada modelo devolvió un objeto JSON analizable que coincidía con nuestro esquema en el primer intento para nuestra plantilla de prompt exacta. Flash Lite empató con Haiku en la cima (>99.5%); grok-4-1-fast quedó justo detrás (~99.3%); GPT-5 Mini se quedó atrás (~97.8%). La diferencia de 1.7 puntos porcentuales entre el primero y el último es dinero real — cada salida mal formada es un reintento, lo que duplica la latencia para ese usuario.
En cuanto a la latencia bajo carga del proveedor: Google tiene la huella de servicio más grande de cualquiera de los cuatro proveedores. La latencia del primer token P99 en Flash Lite se mantuvo por debajo de los 350 ms durante el horario comercial de EE. UU. en nuestras pruebas de carga, sin contención de cola medible. Los otros tres proveedores han mostrado picos fríos de 5 a 15 segundos durante ventanas de alto tráfico en los últimos seis meses. No estamos argumentando que los modelos subyacentes sean más lentos; estamos argumentando que la postura de contención es materialmente mejor en la infraestructura de Google.
En cuanto a la ejecución de producción anterior: enviamos la primera versión de Cambio en grok-4-1-fast y la ejecutamos durante varias semanas. Funcionó. El cambio a Flash Lite (commit el 2026-05-27) no se debió a que Grok estuviera mal, sino a que Gemini era mediblemente mejor en los cuatro ejes anteriores cuando volvimos a ejecutar el conjunto de evaluación. La capa de agente es independiente del proveedor: xAI y OpenAI todavía son seleccionables detrás de un indicador de configuración, y el arnés de prueba continúa simulando a todos ellos. Si Gemini alguna vez retrocede, podemos volver a cambiar con un solo cambio de configuración.
Por qué no la variante de razonamiento
Gemini 2.5 lanza una variante con modo de pensamiento. No la usamos. El modo de pensamiento está diseñado para problemas que se benefician de la cadena de pensamiento: problemas de varios pasos, problemas donde el modelo tiene que considerar alternativas, problemas donde los pasos intermedios de borrador mejoran la respuesta final.
Ninguno de nuestros dos trabajos es ese. Analizar un mensaje corto de usuario en siete campos estructurados no se beneficia de un paso de razonamiento. Narrar un objeto de cotización estructurado en una explicación de una oración no se beneficia de un paso de razonamiento. El modo de pensamiento agregaría 300-800 ms de latencia para una mejora de calidad que no podemos medir. Probamos ambos. La salida sin pensamiento era indistinguible en calidad y ~3 veces más rápida.
Nuestras notas internas fijan esta preferencia explícitamente. Producción ejecuta `gemini-2.5-flash-lite` con el pensamiento desactivado; desarrollo y prueba siempre simulan el LLM completamente a través de `AGENT_STUB_LLM=true` para que el sistema de prueba nunca cobre tokens. La configuración predeterminada se agregó después de que una versión temprana del asistente se conectara accidentalmente a una variante de modo de pensamiento y la latencia en el composer se duplicara de la noche a la mañana. La solución fue un cambio de configuración de una línea. La lección es duradera: para nuestros trabajos, el razonamiento es una sobrecarga.
Lo que estamos renunciando
Divulgación honesta de la compensación. Al no usar un modelo de vanguardia, renunciamos a la capacidad marginal en los prompts más ambiguos. Un usuario que escribe algo genuinamente confuso en el composer podría obtener una pregunta de aclaración ligeramente peor de Flash Lite de la que obtendría de GPT-5. También renunciamos al acceso a ciertas funciones avanzadas que ofrece el nivel de vanguardia: ventanas de contexto de un millón de tokens, cadenas complejas de llamadas a herramientas, razonamiento multimodal profundo, nada de lo cual importa para nuestros trabajos, pero que importaría si alguna vez expandiéramos el alcance del modelo. (No lo haremos, según la publicación anterior de esta serie).
Las compensaciones que no estamos haciendo: no estamos renunciando a la corrección del análisis en el caso común, no estamos renunciando a la calidad de la narración, no estamos renunciando a la latencia, no estamos renunciando a la previsibilidad de costos. Los 0.2-0.5 puntos porcentuales de capacidad marginal que perdemos al elegir un modelo rápido sobre uno de vanguardia es un precio que estamos felices de pagar.
Cuándo volveríamos a considerar
Algunas condiciones específicas nos harían reabrir la selección del modelo.
Si la latencia de Flash Lite se degrada materialmente, digamos que p95 supera los 600 ms durante las horas pico y se mantiene allí durante más de una semana, el presupuesto de latencia se rompe y cambiamos. Nuestro sistema de evaluación se ejecuta continuamente contra los cuatro modelos preseleccionados con nuestra plantilla de prompt exacta, por lo que tenemos números actuales en todo momento.
Si agregamos soporte multilingüe y la calidad de Flash Lite cae más que los otros modelos de nivel rápido en los idiomas específicos que agregamos (español, ruso, chino son los primeros), podemos usar varios proveedores: Gemini para la ruta principal en inglés y un modelo diferente para idiomas donde tiene un rendimiento inferior. La capa del agente ya admite este enrutamiento.
Si los precios cambian sustancialmente, digamos que Google aumenta las tarifas de Flash Lite 5 veces o un competidor reduce a una décima parte, revisamos el eje de costos. No cambiaremos por una diferencia de precio del 10%, pero un cambio estructural importa.
Si un nuevo modelo de otro proveedor supera claramente a Flash Lite en nuestro conjunto de evaluación específico (el benchmark de análisis y el benchmark de narración en nuestros prompts de producción reales, no en tablas de clasificación genéricas), cambiamos. Ejecutamos el conjunto de evaluación mensualmente. La última vez que lo hicimos, Flash Lite ganó todas las celdas relevantes, que es cómo terminamos aquí en primer lugar.
La lección general
Elegir un modelo es una decisión específica de la carga de trabajo, no una decisión de marca. El "mejor" modelo para un producto depende de la forma de los prompts que envías, el presupuesto de latencia que tienes, la disciplina de salida estructurada que necesitas, el sobre de costos a tu escala y la postura del proveedor con la que puedes vivir. Ninguna de esas cosas es visible en una tabla de clasificación. Todas ellas deben medirse contra tu carga de trabajo real, y volver a medirse periódicamente, porque los proveedores lanzan nuevos modelos de nivel rápido cada pocos meses y la respuesta puede cambiar.
Para la forma de Cambio: prompts cortos y simétricos, presupuesto de latencia estricto, dos trabajos estrechos que no necesitan razonamiento, Gemini 2.5 Flash Lite es la respuesta correcta hoy. Para un producto diferente con una forma diferente, la respuesta correcta es genuinamente diferente. Si estás construyendo algo similar, la conclusión no es "usa Gemini Flash Lite". Es "construye una capa de agente independiente del proveedor, prueba el nivel rápido contra tu carga de trabajo real y vuelve a ejecutar la prueba cada trimestre".
La última publicación de esta serie profundiza más que ninguna anterior: cómo funcionan los intercambios entre cadenas en Cambio sin contratos puente, y por qué eso tiene un perfil operativo distinto al de las arquitecturas que usa gran parte de la industria para lo mismo.



