Большинство продуктов, которые в 2026 году ставят модель за интерфейсом чата, выбирают самую умную доступную передовую модель. Cambio работает на Gemini 2.5 Flash Lite. Вот реальный компромисс в инженерии, который привел к этому выбору — включая период, который мы провели сначала с другой моделью быстрого уровня — и условия, которые заставили бы нас снова изменить свое мнение.
Когда вы решаете поставить языковую модель за интерфейсом продукта в 2026 году, самым громким вариантом по умолчанию является использование любой передовой модели, которая имеет наивысший балл в рейтинге месяца. Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra — это названия, которые всплывают, когда команды продукта обсуждают «какой ИИ». Умнее — лучше, гласит аргументация, а разница в стоимости исчезает в масштабе.
Cambio работает на Gemini 2.5 Flash Lite. Не вариант для рассуждений, не передовой вариант — самая маленькая модель быстрого уровня, которую Google поставляет, находящаяся под Flash и далеко под Pro. Мы приняли это решение намеренно, после оценки очевидных альтернатив и эксплуатации другой модели быстрого уровня (grok-4-1-fast от xAI) в продакшене в течение нескольких недель. Этот пост — реальное инженерное обоснование текущего выбора, условия, которые его обусловили, и условия, которые заставили бы нас пересмотреть его снова.
Что модель должна делать в Cambio
Две задачи, обе ограниченные. Ни одна из них не требует интенсивных рассуждений.
Первая — парсинг. Модель принимает короткое сообщение пользователя — обычно от 5 до 30 слов — и извлекает структурированные поля: категория (Swap, Execute, Suggest, Compare, Help, Explore), валюта отправления, сеть отправления, валюта назначения, сеть назначения, сумма, направление. Большинство случаев обрабатываются уровнем регулярных выражений, который работает без модели. Модель вызывается, когда регулярное выражение неуверенно. Результат — JSON-объект максимум из семи полей.
Вторая — объяснение. Модель получает структурированный объект котировки и пишет короткое пояснение простым языком. Ей нельзя указывать цену, курс или сумму; все числа содержит карточка котировки. Результат — одно-два коротких предложения, не более 40 слов.
Ни одна из задач не включает многошаговые рассуждения. Ни одна из задач не требует от модели выбора между множеством альтернатив. Ни одна из задач не предполагает взаимодействия модели с инструментами, вызова API или поддержания состояния между обращениями. Требования к возможностям: чтение короткого запроса, следование структурированному формату вывода, генерация связного английского языка. Каждая современная языковая модель может это сделать, включая модели, выпущенные два или три года назад.
Почему передовые модели для рассуждений — неподходящий инструмент здесь
When we benchmarked the candidates, we ran identical eval batches against Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra, and Gemini 2.5 Flash Lite. The capability ceiling on parse correctness and narration quality maxed out around 99.4-99.6% on every model. The frontier models scored marginally higher on the most ambiguous prompts — the kind where the message is genuinely unclear — but the marginal gain was a few tenths of a percent on a workload that already had a regex pre-filter handling the easy 95%.
Картина затрат была менее незначительной. За миллион токенов передовые модели для рассуждений в 2026 году стоят примерно в 8-20 раз дороже быстрых вариантов. Картина задержки была еще менее незначительной. Задержка первого токена P95 на Claude Opus составляет от 800 до 1500 мс; на GPT-5 — от 600 до 1100 мс; на Gemini 2.5 Flash Lite — от 120 до 300 мс. Для продукта, где общий круговой путь композера должен составлять менее 200 миллисекунд, модель, которая занимает 600 мс для начала первого токена, структурно несовместима.
A 99.5% parse rate at 200 ms is a better product than a 99.7% parse rate at 800 ms. The user experience curve is dominated by latency in the range we operate in. Once the model is fast enough and right enough, more "smart" is wasted budget.
Почему в целом быстрый уровень
Короткий список жизнеспособных моделей для задач Cambio состоит из моделей быстрого уровня от разных поставщиков: Claude Haiku 4.5, GPT-5 Mini, Gemini 2.5 Flash Lite, grok-4-1-fast. Все четыре достаточно способны на тестах парсинга и повествования. Все четыре достаточно быстры, чтобы соответствовать нашему бюджету задержки. Все четыре достаточно дешевы, чтобы стоимость за котировку была незначительной при нашем объеме запуска.
На этом этапе решение заключается не столько в возможностях модели, сколько в операционной пригодности. Мы оценили четыре аспекта: стоимость за котировку при объеме запуска, надежность структурированного вывода, задержка при реальной нагрузке поставщика, а также практическое состояние SDK поставщика и его политика ограничения скорости.
Почему именно Gemini 2.5 Flash Lite
По стоимости: Flash Lite является самой дешевой из четырех по нашему конкретному соотношению входных/выходных токенов. Вызовы парсинга Cambio — короткий ввод, короткий вывод, и цена Flash Lite за миллион на этом симметричном шаблоне короткий/короткий превосходила Haiku, GPT-5 Mini и grok-4-1-fast примерно на 20–60% на уровне вызова. При объеме запуска абсолютная разница составляет несколько долларов в день для всех четырех; при прогнозируемом объеме после запуска разрыв значителен.
On structured-output reliability: Google's `responseSchema` JSON mode is the most disciplined of the four. We measured how often each model returned a parseable JSON object that matched our schema on the first attempt for our exact prompt template. Flash Lite tied with Haiku at the top (>99.5%); grok-4-1-fast was just behind (~99.3%); GPT-5 Mini lagged (~97.8%). The 1.7 percentage points difference between top and bottom is real money — every malformed output is a retry, which doubles the latency for that user.
По задержке при нагрузке поставщика: Google имеет самый большой объем обслуживания среди всех четырех поставщиков. Задержка первого токена P99 на Flash Lite оставалась ниже 350 мс в рабочие часы в США во время наших нагрузочных тестов, без измеримого конфликта очередей. Три других поставщика показали 5–15-секундные пики холостого хода в периоды высокой нагрузки за последние шесть месяцев. Мы не утверждаем, что базовые модели медленнее; мы утверждаем, что позиция конкуренции значительно лучше на инфраструктуре Google.
По предыдущему производственному запуску: мы выпустили первую версию Cambio на grok-4-1-fast и эксплуатировали ее в течение нескольких недель. Это работало. Переход на Flash Lite (коммит от 2026-05-27) был не потому, что Grok был неправильным — а потому, что Gemini оказался измеримо лучше по четырем вышеуказанным осям к моменту повторного запуска набора оценок. Агентский слой не зависит от поставщика: xAI и OpenAI по-прежнему доступны через флаг конфигурации, а тестовый набор продолжает заглушать их всех. Если Gemini когда-либо регрессирует, мы можем вернуться обратно одним изменением конфигурации.
Почему не вариант для рассуждений
Gemini 2.5 поставляется с вариантом режима мышления. Мы его не используем. Режим мышления предназначен для задач, которые выигрывают от цепочки рассуждений — многошаговых задач, задач, где модель должна рассматривать альтернативы, задач, где промежуточные шаги на черновике улучшают окончательный ответ.
Ни одна из наших двух задач не является таковой. Разбор короткого сообщения пользователя на семь структурированных полей не выигрывает от шага рассуждения. Изложение структурированного объекта цитаты в одно предложение объяснения не выигрывает от шага рассуждения. Режим мышления добавит 300-800 мс задержки для улучшения качества, которое мы не можем измерить. Мы протестировали оба варианта. Вывод без режима мышления был неотличим по качеству и примерно в 3 раза быстрее.
Наши внутренние заметки явно указывают на это предпочтение. В продакшене используется `gemini-2.5-flash-lite` с отключенным режимом мышления; в разработке и тестировании LLM всегда полностью заглушается через `AGENT_STUB_LLM=true`, поэтому система никогда не списывает токены. Значение по умолчанию было добавлено после того, как ранняя версия ассистента случайно была направлена на вариант с режимом мышления, и задержка в композере удвоилась за ночь. Исправление заняло одну строку конфигурации. Урок прочен: для наших задач рассуждение — это накладные расходы.
От чего мы отказываемся
Честное раскрытие компромисса. Не используя передовую модель, мы отказываемся от маргинальных возможностей на самых неоднозначных запросах. Пользователь, который вводит что-то действительно запутанное в композер, может получить немного худший уточняющий вопрос от Flash Lite, чем от GPT-5. Мы также отказываемся от доступа к некоторым расширенным функциям, которые предлагает передовой уровень — контекстные окна на миллион токенов, сложные цепочки вызовов инструментов, глубокие мультимодальные рассуждения — ничто из этого не имеет значения для наших задач, но имело бы значение, если бы мы когда-либо расширили область применения модели. (Мы не будем, согласно предыдущему посту в этой серии.)
The trade-offs we are not making: we are not giving up parse correctness on the common case, we are not giving up narration quality, we are not giving up latency, we are not giving up cost predictability. The 0.2-0.5 percentage points of marginal capability we lose to choosing a fast model over a frontier one is a price we are happy to pay.
Когда бы мы пересмотрели
Несколько конкретных условий заставили бы нас снова пересмотреть выбор модели.
Если задержка Flash Lite существенно ухудшится — скажем, p95 поднимется выше 600 мс в часы пик и останется там более недели — бюджет задержки будет нарушен, и мы переключимся. Наша система оценки непрерывно работает со всеми четырьмя моделями из шорт-листа с нашим точным шаблоном запроса, поэтому у нас всегда есть актуальные цифры.
Если мы добавим многоязычную поддержку, а качество Flash Lite упадет больше, чем у других моделей быстрого уровня на конкретных языках, которые мы добавляем (первыми будут испанский, русский, китайский), мы можем перейти на нескольких поставщиков — Gemini для основного английского пути и другую модель для языков, где она работает хуже. Уровень агента уже поддерживает такое маршрутизацию.
Если цены существенно изменятся — скажем, Google поднимет тарифы на Flash Lite в 5 раз или конкурент снизит до десятой части — мы пересмотрим ценовую ось. Мы не будем переключаться из-за разницы в 10% в цене, но структурный сдвиг имеет значение.
Если новая модель от другого поставщика явно превзойдет Flash Lite в нашем конкретном наборе оценок (бенчмарк парсинга и бенчмарк повествования на наших реальных производственных запросах, а не на общих рейтинговых таблицах), мы переключимся. Мы запускаем набор оценок ежемесячно. В последний раз, когда мы это делали, Flash Lite выиграл каждую соответствующую ячейку — именно так мы оказались здесь.
Общий урок
Выбор модели — это решение, специфичное для рабочей нагрузки, а не решение бренда. «Лучшая» модель для продукта зависит от формы отправляемых вами запросов, вашего бюджета задержки, необходимой вам дисциплины структурированного вывода, вашего бюджета затрат в вашем масштабе и позиции поставщика, с которой вы можете смириться. Ничто из этого не видно в рейтинговой таблице. Все это должно быть измерено на вашей фактической рабочей нагрузке — и периодически переизмерено, потому что поставщики выпускают новые модели быстрого уровня каждые несколько месяцев, и ответ может измениться.
Для формы Cambio — короткие симметричные запросы, жесткий бюджет задержки, две узкие задачи, не требующие рассуждений — Gemini 2.5 Flash Lite является правильным ответом сегодня. Для другого продукта с другой формой правильный ответ будет совершенно другим. Если вы строите что-то похожее, вывод не в том, что «используйте Gemini Flash Lite». Это «постройте независимый от поставщика уровень агента, протестируйте быстрый уровень на вашей фактической рабочей нагрузке и повторно запускайте тест каждый квартал».
Последний пост этой серии углубляется дальше, чем все предыдущие: как кросс-чейн обмены в Cambio работают без мост-контрактов и почему это иной операционный профиль, чем у архитектур, которые во многом использует индустрия для той же задачи.



