← 글로 돌아가기

// 운영

왜 GPT-5나 Claude가 아닌 Gemini 2.5 Flash Lite가 Cambio의 컴포저를 구동하는가

June 12, 2026·8분 읽기·Cambio 팀
왜 GPT-5나 Claude가 아닌 Gemini 2.5 Flash Lite가 Cambio의 컴포저를 구동하는가

2026년에 채팅 표면 뒤에 모델을 두는 대부분의 제품은 이용 가능한 가장 똑똑한 최전선 모델을 집어 듭니다. Cambio는 Gemini 2.5 Flash Lite로 구동됩니다. 여기 그 선택으로 이어진 실제 엔지니어링 트레이드오프가 있습니다 — 우리가 먼저 다른 고속 계층 모델을 썼던 기간을 포함해 — 그리고 우리 생각을 다시 바꾸게 할 조건들도 함께.

2026년에 제품 표면 뒤에 언어 모델을 두기로 결정하면, 가장 요란한 기본값은 그 달의 리더보드에서 최고 점수를 받은 최전선 모델을 쓰는 것입니다. Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra — 제품 팀이 "어떤 AI"를 논할 때 나오는 이름들입니다. 더 똑똑한 게 더 낫다는 논리이고, 비용 차이는 규모에서 사라진다는 것이죠.

Cambio는 Gemini 2.5 Flash Lite로 구동됩니다. 추론 변형도, 최전선 변형도 아닌 — Google이 출하하는 가장 작은 고속 계층 모델로, Flash 아래, Pro보다 한참 아래에 위치합니다. 우리는 뻔한 대안들을 평가하고 이전의 고속 계층 모델(xAI의 grok-4-1-fast)을 프로덕션에서 몇 주간 운영한 뒤 이 결정을 의도적으로 내렸습니다. 이 글은 현재 선택 뒤에 있는 실제 엔지니어링 논리, 그것을 이끈 조건들, 그리고 우리가 다시 검토하게 만들 조건들입니다.

모델이 Cambio에서 해야 하는 일

두 가지 작업, 둘 다 범위가 한정되어 있습니다. 어느 쪽도 추론 부담이 크지 않습니다.

첫째는 파싱입니다. 모델은 짧은 사용자 메시지 — 보통 5에서 30 단어 — 를 받아 구조화된 필드를 추출합니다: 카테고리(Swap, Execute, Suggest, Compare, Help, Explore), 송금 통화, 송금 네트워크, 수신 통화, 수신 네트워크, 금액, 방향. 대부분의 경우는 모델 없이 실행되는 정규식 계층이 처리합니다. 정규식이 불확실할 때 모델이 호출됩니다. 출력은 최대 일곱 개 필드를 가진 JSON 객체입니다.

두 번째는 설명입니다. 모델은 구조화된 견적 객체를 받아 쉬운 말로 짧은 설명을 만듭니다. 가격, 환율, 금액은 쓸 수 없으며, 모든 숫자는 견적 카드가 담습니다. 출력은 짧은 한두 문장이며, 40단어를 넘지 않습니다.

어느 작업도 여러 단계의 추론을 수반하지 않습니다. 어느 작업도 모델이 많은 대안 중에서 고르기를 요구하지 않습니다. 어느 작업도 모델이 도구와 상호작용하거나, API를 호출하거나, 턴을 넘어 상태를 유지하지 않습니다. 역량 요건은 이렇습니다: 짧은 프롬프트를 읽고, 구조화된 출력 형식을 따르고, 일관된 영어를 만들어내기. 2~3년 전에 출시된 것을 포함해 모든 현대 언어 모델이 이를 할 수 있습니다.

왜 최전선 추론 모델이 여기서 잘못된 도구인가

후보들을 벤치마킹할 때, 우리는 Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra, Gemini 2.5 Flash Lite에 동일한 평가 배치를 돌렸습니다. 파싱 정확도와 서술 품질에서의 역량 상한은 모든 모델에서 약 99.4~99.6% 부근에서 최고치에 달했습니다. 최전선 모델들은 가장 모호한 프롬프트 — 메시지가 정말로 불분명한 종류 — 에서 근소하게 더 높은 점수를 냈지만, 그 근소한 이득은 이미 쉬운 95%를 정규식 사전 필터가 처리하고 있는 작업에서 몇 십분의 일 퍼센트에 불과했습니다.

비용 그림은 덜 근소했습니다. 백만 토큰당, 2026년의 최전선 추론 모델은 고속 변형의 대략 8배에서 20배로 가격이 매겨집니다. 지연 시간 그림은 더욱 덜 근소했습니다. Claude Opus의 P95 첫 토큰 지연 시간은 800~1500ms 범위이고, GPT-5는 600~1100ms, Gemini 2.5 Flash Lite는 120~300ms입니다. 컴포저 전체 왕복이 200밀리초 미만이어야 하는 제품에서, 첫 토큰을 시작하는 데 600ms가 걸리는 모델은 구조적으로 양립할 수 없습니다.

200ms에서의 99.5% 파싱률이 800ms에서의 99.7% 파싱률보다 나은 제품입니다. 사용자 경험 곡선은 우리가 운영하는 범위에서 지연 시간에 좌우됩니다. 모델이 일단 충분히 빠르고 충분히 정확해지면, 더 많은 "똑똑함"은 낭비된 예산입니다.

왜 고속 계층 전반인가

Cambio의 작업에 유효한 모델 후보 명단은 제공사 전반의 고속 계층에서 나옵니다: Claude Haiku 4.5, GPT-5 Mini, Gemini 2.5 Flash Lite, grok-4-1-fast. 넷 다 파싱과 서술 벤치마크에서 충분히 유능합니다. 넷 다 우리 지연 시간 예산에 들어갈 만큼 충분히 빠릅니다. 넷 다 우리 출시 물량에서 견적당 비용이 무시할 만한 수준으로 충분히 쌉니다.

그 시점에서 결정은 모델 역량보다 운영 적합성에 관한 것이 됩니다. 우리는 네 가지 축을 평가했습니다: 출시 물량에서의 견적당 비용, 구조화된 출력 신뢰성, 현실적인 제공사 부하에서의 지연 시간, 그리고 제공사 SDK와 속도 제한 태세의 실무적 건전성.

구체적으로 왜 Gemini 2.5 Flash Lite인가

비용 측면: Flash Lite는 우리의 구체적인 입력/출력 토큰 조합에서 넷 중 가장 쌉니다. Cambio 파싱 호출은 짧은 입력, 짧은 출력이며, 이 대칭적인 짧은/짧은 패턴에서 Flash Lite의 백만당 가격은 호출당 수준에서 Haiku, GPT-5 Mini, grok-4-1-fast를 약 20~60% 앞섰습니다. 출시 물량에서 절대 차이는 넷 전체에 걸쳐 하루 몇 달러 수준이지만, 예상 출시 후 물량에서는 그 격차가 유의미합니다.

구조화된 출력 신뢰성 측면: Google의 `responseSchema` JSON 모드는 넷 중 가장 규율이 잡혀 있습니다. 우리는 각 모델이 우리의 정확한 프롬프트 템플릿에 대해 첫 시도에서 우리 스키마와 일치하는 파싱 가능한 JSON 객체를 얼마나 자주 반환하는지 측정했습니다. Flash Lite는 Haiku와 함께 최상위(>99.5%)로 동률이었고, grok-4-1-fast가 바로 뒤(~99.3%), GPT-5 Mini가 뒤처졌습니다(~97.8%). 최상위와 최하위 사이의 1.7퍼센트포인트 차이는 실제 돈입니다 — 잘못된 형식의 출력마다 재시도가 발생하고, 이는 그 사용자의 지연 시간을 두 배로 만듭니다.

제공사 부하에서의 지연 시간 측면: Google은 넷 중 어느 제공사보다 가장 큰 서빙 규모를 가지고 있습니다. Flash Lite의 P99 첫 토큰 지연 시간은 우리 부하 테스트에서 미국 업무 시간 동안 350ms 미만을 유지했으며, 측정 가능한 큐 경합이 없었습니다. 다른 세 제공사는 지난 6개월간 고트래픽 구간에서 모두 5~15초의 콜드 스파이크를 보였습니다. 우리는 근본 모델들이 더 느리다고 주장하는 게 아닙니다. 경합 태세가 Google 인프라에서 실질적으로 더 낫다고 주장하는 것입니다.

이전 프로덕션 운영 측면: 우리는 Cambio의 첫 버전을 grok-4-1-fast로 출하해 몇 주간 운영했습니다. 잘 작동했습니다. Flash Lite로의 전환(2026-05-27 커밋)은 Grok이 틀려서가 아니었습니다 — 우리가 평가 스위트를 다시 돌렸을 무렵 Gemini가 위 네 축에서 측정 가능하게 더 나았기 때문입니다. 에이전트 계층은 제공사에 구애받지 않습니다: xAI와 OpenAI는 여전히 구성 플래그 뒤에서 선택 가능하며, 테스트 하니스는 이들 모두를 계속 스텁 처리합니다. 만약 Gemini가 언젠가 퇴보하면 우리는 구성 변경 한 번으로 되돌릴 수 있습니다.

왜 추론 변형은 안 쓰는가

Gemini 2.5는 사고 모드 변형을 출하합니다. 우리는 그것을 쓰지 않습니다. 사고 모드는 사고 사슬로 이득을 보는 문제 — 여러 단계 문제, 모델이 대안을 고려해야 하는 문제, 중간 스크래치패드 단계가 최종 답을 개선하는 문제 — 를 위해 설계되었습니다.

우리의 두 작업 중 어느 쪽도 그런 게 아닙니다. 짧은 사용자 메시지를 일곱 개의 구조화된 필드로 파싱하는 것은 추론 단계로 이득을 보지 않습니다. 구조화된 견적 객체를 한 문장짜리 설명으로 서술하는 것은 추론 단계로 이득을 보지 않습니다. 사고 모드는 우리가 측정할 수 없는 품질 개선을 위해 300~800ms의 지연 시간을 더할 것입니다. 우리는 둘 다 테스트했습니다. 비사고 출력은 품질에서 구별할 수 없었고 약 3배 더 빨랐습니다.

우리 내부 기록은 이 선호를 명시적으로 못 박아 둡니다. 프로덕션은 사고 모드를 끈 `gemini-2.5-flash-lite`를 실행하며, 개발과 테스트는 `AGENT_STUB_LLM=true`로 LLM을 전부 스텁 처리해 하니스가 토큰을 결코 청구하지 않도록 합니다. 이 기본값은 초기 버전의 어시스턴트가 실수로 사고 모드 변형을 가리키게 되어 컴포저의 지연 시간이 하룻밤 사이에 두 배가 된 후 추가되었습니다. 해결책은 한 줄짜리 구성 변경이었습니다. 교훈은 오래갑니다: 우리 작업에서 추론은 부대비용입니다.

우리가 포기하는 것

트레이드오프에 대한 솔직한 고백. 프런티어 모델을 사용하지 않음으로써, 우리는 가장 모호한 프롬프트에서의 한계적 성능을 포기하고 있습니다. 컴포저에 정말로 헷갈리는 무언가를 입력하는 사용자는 GPT-5보다 Flash Lite로부터 다소 못한 확인 질문을 받을 수 있습니다. 또한 우리는 프런티어 등급이 제공하는 특정 고급 기능들 — 백만 토큰 컨텍스트 윈도우, 복잡한 도구 호출 체인, 심층 멀티모달 추론 — 에 대한 접근도 포기하고 있는데, 이 중 어느 것도 우리 작업에는 중요하지 않지만 만약 우리가 언젠가 모델의 범위를 확장한다면 중요해질 것들입니다. (이 시리즈의 이전 글에서 밝혔듯이, 우리는 그러지 않을 것입니다.)

우리가 하지 않는 트레이드오프: 우리는 일반적인 경우의 파싱 정확도를 포기하지 않으며, 내레이션 품질을 포기하지 않고, 지연 시간을 포기하지 않으며, 비용 예측 가능성을 포기하지 않습니다. 프런티어 모델 대신 빠른 모델을 선택함으로써 잃는 0.2-0.5 퍼센트포인트의 한계 성능은 우리가 기꺼이 지불하는 대가입니다.

우리가 다시 검토할 시점

몇 가지 특정 조건이 충족되면 우리는 모델 선택을 다시 열어보게 될 것입니다.

만약 Flash Lite의 지연 시간이 실질적으로 악화된다면 — 이를테면 피크 시간대에 p95가 600ms를 넘어서고 일주일 넘게 그 상태가 지속된다면 — 지연 시간 예산이 무너지고 우리는 전환합니다. 우리의 평가 하네스는 정확히 동일한 프롬프트 템플릿으로 네 개의 최종 후보 모델 모두에 대해 지속적으로 실행되므로, 우리는 항상 최신 수치를 확보하고 있습니다.

만약 우리가 다국어 지원을 추가했을 때 우리가 추가하는 특정 언어(스페인어, 러시아어, 중국어가 먼저)에서 Flash Lite의 품질이 다른 빠른 등급 모델들보다 더 많이 떨어진다면, 우리는 멀티 프로바이더로 전환할 수 있습니다 — 기본 영어 경로에는 Gemini를, 그것이 부진한 언어에는 다른 모델을 사용하는 식으로요. 에이전트 레이어는 이미 이러한 라우팅을 지원합니다.

만약 가격 정책이 크게 바뀐다면 — 이를테면 Google이 Flash Lite 요금을 5배 올리거나 경쟁사가 10분의 1로 내린다면 — 우리는 비용 축을 다시 검토합니다. 우리는 10%의 가격 차이로 전환하지는 않겠지만, 구조적인 변화라면 중요합니다.

만약 다른 프로바이더의 새 모델이 우리의 특정 평가 스위트(일반적인 리더보드가 아니라, 우리의 실제 프로덕션 프롬프트에 대한 파싱 벤치마크와 내레이션 벤치마크)에서 Flash Lite를 명확히 능가한다면, 우리는 전환합니다. 우리는 평가 스위트를 매월 실행합니다. 가장 최근에 실행했을 때 Flash Lite는 관련된 모든 항목에서 승리했으며 — 바로 그것이 애초에 우리가 여기에 이르게 된 이유입니다.

일반적인 교훈

모델을 선택하는 것은 브랜드 결정이 아니라 워크로드에 특화된 결정입니다. 어떤 제품에 "최고의" 모델은 당신이 보내는 프롬프트의 형태, 당신이 가진 지연 시간 예산, 당신에게 필요한 구조화된 출력의 엄격함, 당신의 규모에서의 비용 범위, 그리고 당신이 감당할 수 있는 프로바이더의 태도에 따라 달라집니다. 이 중 어느 것도 리더보드에서는 보이지 않습니다. 이 모든 것은 당신의 실제 워크로드에 대비해 측정되어야 하며 — 그리고 주기적으로 재측정되어야 하는데, 프로바이더들이 몇 달마다 새로운 빠른 등급 모델을 출시하고 정답이 바뀔 수 있기 때문입니다.

Cambio의 형태 — 짧고 대칭적인 프롬프트, 엄격한 지연 시간 예산, 추론이 필요 없는 두 개의 좁은 작업 — 에는 Gemini 2.5 Flash Lite가 오늘의 정답입니다. 다른 형태를 가진 다른 제품에는 정답이 진짜로 다릅니다. 만약 당신이 비슷한 무언가를 만들고 있다면, 핵심은 "Gemini Flash Lite를 써라"가 아닙니다. 그것은 "프로바이더에 구애받지 않는 에이전트 레이어를 구축하고, 실제 워크로드에 대비해 빠른 등급을 테스트하며, 분기마다 그 테스트를 다시 실행하라"입니다.

이 시리즈의 마지막 글은 지금까지보다 더 깊이 들어갑니다: Cambio의 크로스체인 스왑이 브리지 컨트랙트 없이 어떻게 작동하는지, 그리고 그것이 업계의 상당수가 같은 일에 사용하는 아키텍처와 왜 다른 운영 특성을 갖는지 다룹니다.

더 많은 글

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites
Research

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites

읽기 →
고정 환율 vs 변동 환율: 어떤 환율 유형을 선택해야 할까요?
교육

고정 환율 vs 변동 환율: 어떤 환율 유형을 선택해야 할까요?

읽기 →
매 교환 전에 지갑 주소를 확인하는 방법
보안

매 교환 전에 지갑 주소를 확인하는 방법

읽기 →

// 준비 완료

스왑을 해보세요. AI가 스스로 설명합니다.

스왑 시작하기 →