← 返回文章

// 營運

為什麼是 Gemini 2.5 Flash Lite——而非 GPT-5 或 Claude——在驅動 Cambio 的輸入框

June 12, 2026·閱讀時間 8 分鐘·Cambio 團隊
為什麼是 Gemini 2.5 Flash Lite——而非 GPT-5 或 Claude——在驅動 Cambio 的輸入框

2026 年,大多數把模型放在聊天介面背後的產品,都會伸手去拿當下最聰明的頂尖模型。Cambio 跑的是 Gemini 2.5 Flash Lite。以下是導向這個選擇的真實工程權衡——包括我們一開始曾花時間在另一款快速級模型上的那段時間——以及什麼條件會讓我們再次改變主意。

當你在 2026 年決定把一個語言模型放到產品介面背後時,最響亮的預設做法,就是用當月排行榜上分數最高的那個頂尖模型。Claude Opus 4.7、GPT-5、Gemini 2.5 Pro Ultra——這些是產品團隊在討論「用哪個 AI」時會冒出來的名字。愈聰明愈好,這套邏輯是這麼說的,而且規模一大,成本差異就消失了。

Cambio 跑的是 Gemini 2.5 Flash Lite。不是推理版,也不是頂尖版——而是 Google 推出的最小的快速級模型,位在 Flash 之下,遠在 Pro 之下。這是我們刻意做的決定,是在評估過那些顯而易見的替代方案、並在正式環境裡跑了另一款快速級模型(xAI 的 grok-4-1-fast)好幾週之後才下的。這篇文章是目前這個選擇背後真實的工程推理、驅動它的條件,以及會讓我們再次重新檢視的條件。

模型在 Cambio 必須做的事

兩份工作,都有明確界線。兩者都不吃重推理。

第一份是解析。模型接收一段簡短的使用者訊息——通常 5 到 30 個字——並抽取出結構化欄位:類別(Swap、Execute、Suggest、Compare、Help、Explore)、來源幣種、來源網路、目標幣種、目標網路、金額、方向。大多數情況都由一個不需要模型就能執行的正規表示式層處理。只有在正規表示式不確定時才會呼叫模型。輸出是一個最多七個欄位的 JSON 物件。

第二件是敘述。模型接收一個結構化的報價物件,並以淺白的文字產出簡短說明。它不可以寫出價格、匯率或金額;每一個數字都由報價卡呈現。輸出是一兩句簡短的句子,絕不超過 40 個字。

兩份工作都不涉及多步推理。兩份工作都不要求模型在眾多選項間抉擇。兩份工作都不需要模型與工具互動、呼叫 API 或跨回合保有狀態。所需的能力是:讀一段簡短提示、遵循結構化輸出格式、產出通順的英文。每一款現代語言模型都做得到,包括兩三年前推出的那些。

為什麼頂尖推理模型在這裡是錯的工具

我們對候選者做基準測試時,用相同的評測批次去跑 Claude Opus 4.7、GPT-5、Gemini 2.5 Pro Ultra 以及 Gemini 2.5 Flash Lite。在解析正確率與敘述品質上的能力天花板,每款模型都約在 99.4-99.6% 觸頂。頂尖模型在最含糊的提示上——那種訊息真的不清不楚的——分數略高一些,但在一個本就有正規表示式預先過濾器處理掉簡單 95% 的工作負載上,那點邊際增益不過幾個十分之一百分點。

成本這方面就沒那麼邊際了。以每百萬 token 計,2026 年的頂尖推理模型定價大約是快速版的 8 到 20 倍。延遲這方面更不邊際。Claude Opus 的 P95 首個 token 延遲落在 800-1500 毫秒;GPT-5 是 600-1100 毫秒;Gemini 2.5 Flash Lite 是 120-300 毫秒。對一個輸入框往返總時間理應在 200 毫秒以內的產品而言,一個要花 600 毫秒才吐出第一個 token 的模型,在結構上就不相容。

在 200 毫秒下達到 99.5% 的解析率,是比在 800 毫秒下達到 99.7% 更好的產品。在我們所處的區間裡,使用者體驗曲線是由延遲主導的。一旦模型夠快、也夠準,更多的「聰明」就是浪費預算。

為什麼整體上選快速級

適合 Cambio 這些工作的可行模型清單,來自各家供應商的快速級:Claude Haiku 4.5、GPT-5 Mini、Gemini 2.5 Flash Lite、grok-4-1-fast。這四款在解析與敘述的基準測試上都夠有能力。四款都夠快,能塞進我們的延遲預算。四款都夠便宜,在我們的上線量下每筆報價的成本都微不足道。

到了這一步,決策就不那麼關乎模型能力,而更關乎營運上的契合度。我們從四個面向來評估:上線量下的每筆報價成本、結構化輸出的可靠度、真實供應商負載下的延遲,以及該供應商 SDK 與限流機制的實際健康狀態。

為什麼特別是 Gemini 2.5 Flash Lite

論成本:在我們特定的輸入/輸出 token 組合上,Flash Lite 是四者中最便宜的。Cambio 的解析呼叫是短輸入、短輸出,而 Flash Lite 在這種對稱的短/短模式上的每百萬定價,就每次呼叫的層級而言,比 Haiku、GPT-5 Mini 和 grok-4-1-fast 便宜約 20–60%。在上線量下,四者間的絕對差異是每天幾塊美元;到了預估的上線後量,這個差距就有意義了。

論結構化輸出的可靠度:Google 的 `responseSchema` JSON 模式是四者中最嚴謹的。我們量測了每款模型針對我們確切的提示模板,首次嘗試就回傳一個可解析、且符合我們結構描述的 JSON 物件的頻率。Flash Lite 與 Haiku 並列榜首(>99.5%);grok-4-1-fast 稍微落後(約 99.3%);GPT-5 Mini 墊底(約 97.8%)。榜首與墊底之間 1.7 個百分點的差距是真金白銀——每一個格式錯誤的輸出都是一次重試,會讓那位使用者的延遲加倍。

論供應商負載下的延遲:Google 擁有四家供應商中最大的服務規模。在我們的負載測試中,Flash Lite 的 P99 首個 token 延遲在美國營業時段內維持在 350 毫秒以下,且沒有可量測的佇列爭用。另外三家供應商在過去六個月的高流量時段裡,都出現過 5–15 秒的冷啟動尖峰。我們並不是說底層模型比較慢;我們是說在 Google 的基礎設施上,爭用的態勢明顯更好。

論先前的正式環境運行:我們用 grok-4-1-fast 出貨了 Cambio 的第一個版本,並跑了好幾週。它運作良好。切換到 Flash Lite(2026-05-27 的提交)並不是因為 Grok 有錯——而是等到我們重新跑評測套件時,Gemini 在上述四個面向上已可量測地更好。代理層與供應商無關:xAI 與 OpenAI 仍可透過一個組態旗標來選用,測試框架也繼續把它們全部打樁替換。如果 Gemini 哪天退步,我們只要改一個組態就能翻回去。

為什麼不用推理版

Gemini 2.5 有推出一個思考模式版。我們不用它。思考模式是為那些能從思維鏈中獲益的問題而設計的——多步驟問題、模型必須權衡各種選項的問題、中途的草稿步驟能改善最終答案的問題。

我們那兩份工作都不是這種。把一段簡短的使用者訊息解析成七個結構化欄位,並不會從一個推理步驟中獲益。把一個結構化的報價物件敘述成一句話的說明,也不會從一個推理步驟中獲益。思考模式會增加 300-800 毫秒的延遲,換來的品質提升我們卻量測不到。兩者我們都測了。非思考的輸出在品質上難以區分,而且約快 3 倍。

我們的內部筆記明白地記下了這個偏好。正式環境跑的是 `gemini-2.5-flash-lite` 且關閉思考;開發與測試環境則一律透過 `AGENT_STUB_LLM=true` 把 LLM 完全打樁,讓測試框架永遠不會消耗 token 費用。這個預設值,是在助理的某個早期版本不小心被指向了思考模式版、導致輸入框的延遲一夜之間加倍之後才加上的。修正只是改一行組態。這個教訓歷久彌新:對我們這些工作而言,推理是額外的負擔。

我們所放棄的

誠實揭露這項取捨。由於不採用前沿模型,我們在最模稜兩可的提示上放棄了那一點邊際能力。使用者在對話框中輸入某些真正令人費解的內容時,Flash Lite 給出的釐清問句,可能會比 GPT-5 稍差一些。我們同時也放棄了前沿級別所提供的某些進階功能——百萬 token 的脈絡視窗、複雜的工具呼叫鏈、深度多模態推理——這些對我們的工作都無關緊要,但若我們哪天擴展模型的職責範圍,它們就會變得重要。(依照本系列的前一篇文章,我們並不會這麼做。)

我們沒有做出的取捨:我們沒有放棄常見情境下的解析正確性,沒有放棄敘述品質,沒有放棄延遲表現,也沒有放棄成本的可預測性。選擇快速模型而非前沿模型所損失的 0.2 至 0.5 個百分點的邊際能力,是我們樂意付出的代價。

我們會在什麼時候重新評估

有幾個特定條件會讓我們重新檢視模型的選擇。

若 Flash Lite 的延遲明顯惡化——例如尖峰時段 p95 攀升至 600 毫秒以上,且持續超過一週——延遲預算便會失守,我們就會更換模型。我們的評估框架會持續針對入選的全部四個模型、以我們確切的提示範本進行測試,因此我們隨時掌握最新的數據。

若我們加入多語言支援,而 Flash Lite 在我們新增的特定語言(先從西班牙文、俄文、中文開始)上的品質下滑幅度比其他快速級別模型更大,我們或許會走向多供應商路線——主要的英文路徑用 Gemini,而在它表現不佳的語言上改用另一個模型。代理層已經支援這種路由。

若定價出現大幅變動——例如 Google 將 Flash Lite 的費率調高 5 倍,或某個競爭對手降到十分之一——我們就會重新檢視成本這一軸。我們不會為了 10% 的價差而更換,但結構性的轉變則另當別論。

若某個來自其他供應商的新模型,在我們特定的評估套件上(也就是針對我們實際生產環境提示所做的解析基準與敘述基準,而非通用排行榜)明顯勝過 Flash Lite,我們就會更換。我們每月執行一次評估套件。上一次執行時,Flash Lite 在每一個相關項目上都勝出——這也正是我們一開始會選它的原因。

普遍的啟示

選擇模型是一項取決於工作負載的決策,而非取決於品牌的決策。對一項產品而言,「最好」的模型取決於你所傳送提示的形態、你所擁有的延遲預算、你所需要的結構化輸出紀律、你在自身規模下的成本範圍,以及你能接受的供應商立場。這些因素沒有一項會顯示在排行榜上。它們全都必須對照你實際的工作負載來衡量——而且要定期重新衡量,因為供應商每隔幾個月就會推出新的快速級別模型,答案也可能隨之改變。

以 Cambio 的形態而言——簡短對稱的提示、嚴格的延遲預算、兩項不需要推理的狹窄工作——Gemini 2.5 Flash Lite 是目前正確的答案。對於形態不同的另一項產品,正確答案確實會不一樣。如果你正在打造任何類似的東西,真正的重點不是「用 Gemini Flash Lite」,而是「打造一個與供應商無關的代理層、以你實際的工作負載測試快速級別,並每季重新執行一次測試」。

本系列的最後一篇文章會比目前為止的任何一篇都更深入:Cambio 上的跨鏈兌換如何在沒有跨鏈橋合約的情況下運作,以及為什麼這與業界許多業者用來做同一件事的架構,在營運特性上有所不同。

更多文章

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites
Research

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites

閱讀 →
固定匯率 vs 浮動匯率:你該選擇哪一種?
教學

固定匯率 vs 浮動匯率:你該選擇哪一種?

閱讀 →
如何在每次兌換前驗證你的錢包地址
安全

如何在每次兌換前驗證你的錢包地址

閱讀 →

// 準備就緒

試試兌換。AI 會自行說明。

開始兌換 →