← 記事一覧に戻る

// オペレーション

なぜGPT-5でもClaudeでもなくGemini 2.5 Flash LiteがCambioのコンポーザーを動かすのか

June 12, 2026·読了8分·Cambioチーム
なぜGPT-5でもClaudeでもなくGemini 2.5 Flash LiteがCambioのコンポーザーを動かすのか

2026年にチャットの表層の裏にモデルを置くプロダクトのほとんどは、利用可能な中で最も賢いフロンティアモデルに手を伸ばします。CambioはGemini 2.5 Flash Liteで動いています。その選択に至った実際のエンジニアリング上のトレードオフ——最初に別のファストティアのモデルに費やした期間も含めて——と、私たちが再び考えを変えることになる条件を、ここに記します。

2026年にプロダクトの表層の裏に言語モデルを置くと決めたとき、最も声高なデフォルトは、その月のリーダーボードで最高スコアを持つフロンティアモデルを使うことです。Claude Opus 4.7、GPT-5、Gemini 2.5 Pro Ultra——プロダクトチームが「どのAIか」を議論するときに挙がるのはこうした名前です。賢いほど良い、というのがその論理であり、コストの差は規模が大きくなれば消えると言われます。

CambioはGemini 2.5 Flash Liteで動いています。推論バリアントでもなく、フロンティアバリアントでもなく——Googleが提供する中で最小のファストティアのモデルで、Flashの下、Proのはるか下に位置します。私たちはこの決定を、明白な代替案を評価し、以前のファストティアのモデル(xAIのgrok-4-1-fast)を数週間本番で稼働させた上で、意図的に下しました。この投稿は、現在の選択の背後にある実際のエンジニアリング上の理由、それを促した条件、そして私たちが再び見直すことになる条件についてのものです。

モデルがCambioで担うべき仕事

仕事は2つ、どちらも範囲が限定されています。いずれも推論負荷は高くありません。

1つ目は解析です。モデルは短いユーザーメッセージ——通常5〜30語——を受け取り、構造化されたフィールドを抽出します。カテゴリ(Swap、Execute、Suggest、Compare、Help、Explore)、送り元通貨、送り元ネットワーク、送り先通貨、送り先ネットワーク、金額、方向です。ほとんどのケースは、モデルなしで動作する正規表現レイヤーで処理されます。モデルが呼び出されるのは、正規表現が確信を持てないときです。出力は最大7フィールドのJSONオブジェクトです。

ふたつ目はナレーションです。モデルは構造化された見積もりオブジェクトを受け取り、平易な言葉で短い説明を生成します。価格、レート、金額を書くことは許されておらず、すべての数値は見積もりカードに表示されます。出力は短い文がひとつかふたつで、40語を超えることはありません。

どちらの仕事も多段階の推論を伴いません。どちらの仕事もモデルが多数の選択肢から選ぶ必要はありません。どちらの仕事もモデルがツールと相互作用したり、APIを呼び出したり、ターンをまたいで状態を保持したりすることはありません。求められる能力は、短いプロンプトを読み、構造化された出力フォーマットに従い、一貫した英語を生成することです。これは、2〜3年前にローンチされたものも含め、あらゆる現代の言語モデルができることです。

なぜフロンティアの推論モデルはここでは間違った道具なのか

候補をベンチマークした際、私たちはClaude Opus 4.7、GPT-5、Gemini 2.5 Pro Ultra、そしてGemini 2.5 Flash Liteに対して同一の評価バッチを走らせました。解析の正確さとナレーションの品質における能力の上限は、どのモデルでも99.4〜99.6%あたりで頭打ちになりました。フロンティアモデルは最も曖昧なプロンプト——メッセージが本当に不明瞭なタイプ——でわずかに高いスコアを出しましたが、その限界的な向上は、すでに正規表現の事前フィルターが簡単な95%を処理しているワークロードにおいて、コンマ数パーセントにすぎませんでした。

コストの状況は、それほど限界的ではありませんでした。100万トークンあたりで見ると、2026年のフロンティア推論モデルの価格はファストバリアントのおよそ8〜20倍です。レイテンシの状況はさらに限界的ではありませんでした。Claude Opusの最初のトークンまでのP95レイテンシは800〜1500ミリ秒の範囲、GPT-5では600〜1100ミリ秒、Gemini 2.5 Flash Liteでは120〜300ミリ秒です。コンポーザーの往復全体が200ミリ秒未満であるべきプロダクトにとって、最初のトークンを出し始めるのに600ミリ秒かかるモデルは構造的に相容れません。

200ミリ秒での99.5%の解析率は、800ミリ秒での99.7%の解析率よりも優れたプロダクトです。私たちが運用する範囲では、ユーザー体験の曲線はレイテンシに支配されます。モデルが十分に速く、十分に正確になった時点で、それ以上の「賢さ」は予算の無駄なのです。

そもそもなぜファストティアなのか

Cambioの仕事に適した実行可能なモデルの候補リストは、各プロバイダーのファストティアから来ています。Claude Haiku 4.5、GPT-5 Mini、Gemini 2.5 Flash Lite、grok-4-1-fastです。4つとも解析とナレーションのベンチマークで十分な能力があります。4つとも私たちのレイテンシ予算に収まるほど速いです。4つとも十分に安価で、私たちのローンチ時のボリュームではクオートあたりのコストは無視できます。

その時点で、決定はモデルの能力よりも運用上の適合性に関わるものになります。私たちは4つの軸を評価しました。ローンチ時ボリュームでのクオートあたりのコスト、構造化出力の信頼性、現実的なプロバイダー負荷下でのレイテンシ、そしてプロバイダーのSDKとレート制限の姿勢の実際的な健全性です。

なぜ具体的にGemini 2.5 Flash Liteなのか

コストについて。Flash Liteは、私たちの特定の入出力トークン構成において4つの中で最も安価です。Cambioの解析呼び出しは短い入力、短い出力であり、この対称的な短短パターンにおけるFlash Liteの100万トークンあたりの価格は、呼び出しあたりのレベルでHaiku、GPT-5 Mini、grok-4-1-fastを約20〜60%下回りました。ローンチ時ボリュームでは4つ全体の絶対的な差は1日あたり数ドルですが、ローンチ後の予測ボリュームではその差は無視できないものになります。

構造化出力の信頼性について。Googleの`responseSchema` JSONモードは4つの中で最も規律正しいものです。私たちは、各モデルが私たちの正確なプロンプトテンプレートに対して、最初の試行でスキーマに一致する解析可能なJSONオブジェクトをどのくらいの頻度で返すかを測定しました。Flash LiteはHaikuと並んで首位(99.5%超)、grok-4-1-fastはわずかに後ろ(約99.3%)、GPT-5 Miniは遅れをとりました(約97.8%)。首位と最下位の間の1.7ポイントの差は本物のお金です——不正な形式の出力はすべてリトライとなり、そのユーザーのレイテンシが倍になります。

プロバイダー負荷下でのレイテンシについて。Googleは4つのプロバイダーのいずれよりも大きな配信フットプリントを持っています。Flash Liteの最初のトークンまでのP99レイテンシは、私たちの負荷テストにおいて米国の営業時間中も350ミリ秒未満を維持し、測定可能なキューの競合はありませんでした。他の3つのプロバイダーはいずれも、過去6か月間のトラフィックの多い時間帯に5〜15秒のコールドスパイクを示しています。私たちは基盤となるモデルが遅いと主張しているのではありません。競合の姿勢がGoogleのインフラで明らかに優れていると主張しているのです。

以前の本番稼働について。私たちはCambioの最初のバージョンをgrok-4-1-fastで出荷し、数週間稼働させました。うまく機能しました。Flash Liteへの切り替え(2026-05-27のコミット)は、Grokが間違っていたからではありません——評価スイートを再実行した時点で、上記の4つの軸においてGeminiが測定可能なほど優れていたからです。エージェントレイヤーはプロバイダーに依存しません。xAIとOpenAIは今も設定フラグの裏で選択可能で、テストハーネスは引き続きそれらすべてをスタブ化します。もしGeminiが劣化することがあれば、1つの設定変更で元に戻せます。

なぜ推論バリアントではないのか

Gemini 2.5には思考モードのバリアントがあります。私たちはそれを使いません。思考モードは、思考の連鎖から恩恵を受ける問題——多段階の問題、モデルが選択肢を検討しなければならない問題、中間のスクラッチパッドのステップが最終的な答えを改善する問題——のために設計されています。

私たちの2つの仕事のどちらもそうではありません。短いユーザーメッセージを7つの構造化フィールドに解析することは、推論ステップから恩恵を受けません。構造化されたクオートオブジェクトを一文の説明にナレーションすることも、推論ステップから恩恵を受けません。思考モードは、私たちには測定できない品質向上のために300〜800ミリ秒のレイテンシを追加するだけです。私たちは両方をテストしました。思考なしの出力は品質において見分けがつかず、約3倍速かったのです。

私たちの内部メモは、この選好を明示的に固定しています。本番は思考オフで`gemini-2.5-flash-lite`を動かし、開発とテストは常に`AGENT_STUB_LLM=true`でLLMを完全にスタブ化するため、ハーネスがトークンを課金することはありません。このデフォルトは、初期バージョンのアシスタントが誤って思考モードのバリアントに向けられ、コンポーザーのレイテンシが一晩で倍になった後に追加されました。修正は1行の設定変更でした。教訓は普遍的です。私たちの仕事にとって、推論はオーバーヘッドなのです。

私たちが手放すもの

トレードオフを正直に開示します。フロンティアモデルを使わないことで、最も曖昧なプロンプトにおける限界的な能力を手放しています。コンポーザーに本当に紛らわしい内容を入力したユーザーは、GPT-5から得られるよりも少し質の劣る確認質問をFlash Liteから受け取るかもしれません。また、フロンティアティアが提供する特定の高度な機能——100万トークンのコンテキストウィンドウ、複雑なツール呼び出しチェーン、深いマルチモーダル推論——へのアクセスも手放しています。これらはいずれも私たちの仕事には関係ありませんが、もしモデルの用途を拡張することがあれば重要になるものです。(本シリーズの前回の記事のとおり、拡張するつもりはありません。)

私たちが行っていないトレードオフ:一般的なケースでのパース精度を手放しているわけではなく、ナレーションの品質を手放しているわけでもなく、レイテンシを手放しているわけでもなく、コストの予測可能性を手放しているわけでもありません。フロンティアモデルではなく高速モデルを選ぶことで失う0.2〜0.5パーセントポイントの限界的な能力は、喜んで支払う代償です。

私たちが見直すとき

いくつかの特定の条件が揃えば、モデル選定を再び見直すことになります。

Flash Liteのレイテンシが著しく悪化した場合——たとえばp95がピーク時間帯に600msを超え、1週間以上その状態が続いた場合——レイテンシ予算が破綻するので切り替えます。私たちの評価ハーネスは、正確なプロンプトテンプレートを用いて4つの最終候補モデルすべてに対して継続的に実行されているため、常に最新の数値を把握しています。

多言語対応を追加し、私たちが追加する特定の言語(スペイン語、ロシア語、中国語が最初)においてFlash Liteの品質が他の高速ティアのモデルよりも大きく低下した場合、マルチプロバイダー化するかもしれません——主要な英語パスにはGemini、性能が劣る言語には別のモデルを使うという形です。エージェント層はすでにこのルーティングをサポートしています。

価格が大幅に変わった場合——たとえばGoogleがFlash Liteのレートを5倍に引き上げたり、競合が10分の1に値下げしたりした場合——コストの軸を見直します。10%の価格差では切り替えませんが、構造的な変化は重要です。

別のプロバイダーの新しいモデルが、私たちの特定の評価スイート(一般的なリーダーボードではなく、実際の本番プロンプトでのパースベンチマークとナレーションベンチマーク)でFlash Liteを明確に上回った場合、切り替えます。評価スイートは毎月実行しています。前回実行したとき、Flash Liteは関連するすべてのセルで勝利しました——それがそもそも私たちがここに行き着いた経緯です。

一般的な教訓

モデルを選ぶことは、ブランドの決定ではなく、ワークロード固有の決定です。プロダクトにとっての「最良の」モデルは、送信するプロンプトの形状、抱えているレイテンシ予算、必要とする構造化出力の規律、自社の規模でのコスト枠、そして許容できるプロバイダーの姿勢によって決まります。これらのどれもリーダーボードには表れません。すべては実際のワークロードに対して測定される必要があり——そして定期的に再測定される必要があります。プロバイダーは数か月ごとに新しい高速ティアのモデルを出荷し、答えは変わりうるからです。

Cambioの形状——短く対称的なプロンプト、厳しいレイテンシ予算、推論を必要としない2つの狭い仕事——にとって、Gemini 2.5 Flash Liteは今日の正解です。異なる形状の異なるプロダクトにとっては、正解は本当に異なります。もし似たようなものを構築しているなら、教訓は「Gemini Flash Liteを使え」ではありません。「プロバイダーに依存しないエージェント層を構築し、高速ティアを実際のワークロードに対してテストし、四半期ごとにテストを再実行せよ」ということです。

このシリーズ最後の記事では、これまで以上に踏み込んで、Cambioのクロスチェーンスワップがブリッジコントラクトなしでどのように機能するのか、そしてそれが業界の多くで同じ用途に使われているアーキテクチャとはなぜ運用面の性質が異なるのかを説明します。

その他の記事

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites
Research

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites

読む →
固定レート vs 変動レート:どちらのレートタイプを選ぶべきか?
解説

固定レート vs 変動レート:どちらのレートタイプを選ぶべきか?

読む →
交換のたびにウォレットアドレスを確認する方法
セキュリティ

交換のたびにウォレットアドレスを確認する方法

読む →

// 準備完了

スワップを試してみましょう。AIが自ら説明します。

スワップを開始 →