← Quay lại danh sách bài viết

// VẬN HÀNH

Tại sao Gemini 2.5 Flash Lite — Không phải GPT-5 hay Claude — Vận hành Khung soạn thảo của Cambio

June 12, 2026·Đọc trong 8 phút·Đội ngũ Cambio
Tại sao Gemini 2.5 Flash Lite — Không phải GPT-5 hay Claude — Vận hành Khung soạn thảo của Cambio

Hầu hết các sản phẩm đặt một mô hình sau một bề mặt trò chuyện vào năm 2026 đều với tới mô hình tiên phong thông minh nhất hiện có. Cambio chạy trên Gemini 2.5 Flash Lite. Đây là sự đánh đổi kỹ thuật thực sự dẫn đến lựa chọn đó — bao gồm giai đoạn chúng tôi đã dùng một mô hình tầng nhanh khác trước tiên — và những điều kiện sẽ khiến chúng tôi thay đổi quyết định một lần nữa.

Khi bạn quyết định đặt một mô hình ngôn ngữ sau một bề mặt sản phẩm vào năm 2026, mặc định lớn tiếng nhất là dùng bất kỳ mô hình tiên phong nào có điểm cao nhất trên bảng xếp hạng của tháng. Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra — đây là những cái tên xuất hiện khi các đội sản phẩm bàn về "chọn AI nào." Thông minh hơn thì tốt hơn, lập luận là vậy, và khác biệt về chi phí biến mất khi ở quy mô lớn.

Cambio chạy trên Gemini 2.5 Flash Lite. Không phải biến thể suy luận, không phải biến thể tiên phong — mô hình tầng nhanh nhỏ nhất mà Google phát hành, nằm dưới Flash và thấp hơn nhiều so với Pro. Chúng tôi đưa ra quyết định đó một cách có chủ đích, sau khi đánh giá các phương án hiển nhiên và chạy một mô hình tầng nhanh trước đó (grok-4-1-fast của xAI) trong môi trường thực tế suốt vài tuần. Bài đăng này là lập luận kỹ thuật thực sự đằng sau lựa chọn hiện tại, những điều kiện đã thúc đẩy nó, và những điều kiện sẽ khiến chúng tôi xem xét lại một lần nữa.

Mô hình phải làm gì tại Cambio

Hai công việc, cả hai đều có giới hạn. Không công việc nào nặng về suy luận.

Công việc đầu tiên là phân tích. Mô hình nhận một thông điệp ngắn của người dùng — thường 5 đến 30 từ — và trích xuất các trường có cấu trúc: danh mục (Swap, Execute, Suggest, Compare, Help, Explore), tiền-nguồn, mạng-nguồn, tiền-đích, mạng-đích, số tiền, hướng. Hầu hết các trường hợp được xử lý bởi một lớp regex chạy không cần mô hình. Mô hình được gọi khi regex không chắc chắn. Đầu ra là một đối tượng JSON với tối đa bảy trường.

Việc thứ hai là tường thuật. Mô hình nhận một đối tượng báo giá có cấu trúc và viết ra một lời giải thích ngắn bằng ngôn ngữ dễ hiểu. Nó không được phép viết giá, tỷ giá hay số tiền; thẻ báo giá mang mọi con số. Đầu ra là một hoặc hai câu ngắn, không bao giờ quá 40 từ.

Không công việc nào liên quan đến suy luận nhiều bước. Không công việc nào đòi hỏi mô hình chọn giữa nhiều phương án. Không công việc nào có mô hình tương tác với công cụ, gọi API, hay giữ trạng thái qua các lượt. Yêu cầu năng lực là: đọc một prompt ngắn, tuân theo định dạng đầu ra có cấu trúc, tạo ra tiếng Anh mạch lạc. Mọi mô hình ngôn ngữ hiện đại đều làm được điều này, kể cả những mô hình ra mắt hai hay ba năm trước.

Tại sao các mô hình suy luận tiên phong là công cụ sai ở đây

Khi chúng tôi đánh giá các ứng viên, chúng tôi chạy các lô đánh giá giống hệt nhau trên Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra, và Gemini 2.5 Flash Lite. Trần năng lực về độ chính xác phân tích và chất lượng tường thuật chạm đỉnh khoảng 99,4-99,6% trên mọi mô hình. Các mô hình tiên phong ghi điểm nhỉnh hơn một chút trên các prompt mơ hồ nhất — kiểu mà thông điệp thực sự không rõ ràng — nhưng mức tăng biên chỉ là vài phần mười phần trăm trên một khối lượng công việc vốn đã có một bộ tiền lọc regex xử lý 95% dễ dàng.

Bức tranh chi phí thì ít biên hơn. Trên mỗi triệu token, các mô hình suy luận tiên phong vào năm 2026 được định giá gấp khoảng 8 đến 20 lần các biến thể nhanh. Bức tranh độ trễ còn ít biên hơn nữa. Độ trễ token đầu tiên P95 trên Claude Opus nằm trong khoảng 800-1500 ms; trên GPT-5 là 600-1100 ms; trên Gemini 2.5 Flash Lite là 120-300 ms. Đối với một sản phẩm mà tổng thời gian khứ hồi của khung soạn thảo phải dưới 200 mili giây, một mô hình mất 600 ms để bắt đầu token đầu tiên là không tương thích về mặt cấu trúc.

Tỷ lệ phân tích 99,5% ở 200 ms là một sản phẩm tốt hơn tỷ lệ phân tích 99,7% ở 800 ms. Đường cong trải nghiệm người dùng bị chi phối bởi độ trễ trong khoảng chúng tôi vận hành. Một khi mô hình đủ nhanh và đủ đúng, thêm "thông minh" là ngân sách lãng phí.

Tại sao lại là tầng nhanh nói chung

Danh sách rút gọn các mô hình khả thi cho các công việc của Cambio đến từ tầng nhanh trên khắp các nhà cung cấp: Claude Haiku 4.5, GPT-5 Mini, Gemini 2.5 Flash Lite, grok-4-1-fast. Cả bốn đều đủ năng lực trên các bài đánh giá phân tích và tường thuật. Cả bốn đều đủ nhanh để nằm gọn trong ngân sách độ trễ của chúng tôi. Cả bốn đều đủ rẻ để chi phí mỗi báo giá là không đáng kể ở khối lượng ra mắt của chúng tôi.

Đến điểm đó, quyết định ít về năng lực mô hình mà nhiều hơn về sự phù hợp vận hành. Chúng tôi đánh giá bốn trục: chi phí mỗi báo giá ở khối lượng ra mắt, độ tin cậy của đầu ra có cấu trúc, độ trễ dưới tải nhà cung cấp thực tế, và sức khỏe thực tiễn của SDK cùng tư thế giới hạn tốc độ của nhà cung cấp.

Tại sao cụ thể là Gemini 2.5 Flash Lite

Về chi phí: Flash Lite là mô hình rẻ nhất trong bốn mô hình trên hỗn hợp token đầu vào/đầu ra cụ thể của chúng tôi. Các lệnh gọi phân tích của Cambio là đầu vào ngắn, đầu ra ngắn, và mức giá trên mỗi triệu của Flash Lite trên mẫu ngắn/ngắn đối xứng này vượt Haiku, GPT-5 Mini, và grok-4-1-fast khoảng 20–60% ở cấp độ mỗi lệnh gọi. Ở khối lượng ra mắt, khác biệt tuyệt đối là vài đô la mỗi ngày trên cả bốn; ở khối lượng dự kiến sau ra mắt, khoảng cách trở nên đáng kể.

Về độ tin cậy của đầu ra có cấu trúc: chế độ JSON `responseSchema` của Google là kỷ luật nhất trong bốn. Chúng tôi đo tần suất mỗi mô hình trả về một đối tượng JSON phân tích được khớp với schema của chúng tôi ngay lần thử đầu tiên đối với mẫu prompt chính xác của chúng tôi. Flash Lite ngang bằng Haiku ở vị trí dẫn đầu (>99,5%); grok-4-1-fast bám ngay sau (~99,3%); GPT-5 Mini tụt lại (~97,8%). Khác biệt 1,7 điểm phần trăm giữa đỉnh và đáy là tiền thật — mỗi đầu ra sai định dạng là một lần thử lại, làm gấp đôi độ trễ cho người dùng đó.

Về độ trễ dưới tải nhà cung cấp: Google có dấu chân phục vụ lớn nhất trong bốn nhà cung cấp. Độ trễ token đầu tiên P99 trên Flash Lite giữ dưới 350 ms trong giờ làm việc ở Mỹ trong các bài kiểm tra tải của chúng tôi, không có tranh chấp hàng đợi đo lường được. Ba nhà cung cấp còn lại đều đã cho thấy các cú tăng vọt lạnh 5–15 giây trong các khung giờ cao điểm trong sáu tháng qua. Chúng tôi không lập luận rằng các mô hình nền tảng chậm hơn; chúng tôi lập luận rằng tư thế tranh chấp tốt hơn đáng kể trên hạ tầng của Google.

Về lần chạy sản xuất trước đó: chúng tôi ra mắt phiên bản đầu tiên của Cambio trên grok-4-1-fast và chạy nó suốt vài tuần. Nó hoạt động. Việc chuyển sang Flash Lite (commit ngày 2026-05-27) không phải vì Grok sai — mà là vì Gemini tốt hơn một cách đo lường được trên bốn trục ở trên vào thời điểm chúng tôi chạy lại bộ đánh giá. Lớp agent trung lập với nhà cung cấp: xAI và OpenAI vẫn có thể chọn được sau một cờ cấu hình, và bộ khung kiểm thử tiếp tục giả lập (stub) tất cả. Nếu Gemini có bao giờ suy giảm, chúng tôi có thể lật ngược lại chỉ bằng một thay đổi cấu hình.

Tại sao không dùng biến thể suy luận

Gemini 2.5 có một biến thể chế độ tư duy. Chúng tôi không dùng nó. Chế độ tư duy được thiết kế cho những bài toán hưởng lợi từ chuỗi suy nghĩ — các bài toán nhiều bước, các bài toán mà mô hình phải cân nhắc các phương án, các bài toán mà những bước nháp trung gian cải thiện câu trả lời cuối cùng.

Không công việc nào trong hai công việc của chúng tôi là như vậy. Phân tích một thông điệp ngắn của người dùng thành bảy trường có cấu trúc không hưởng lợi từ một bước suy luận. Tường thuật một đối tượng báo giá có cấu trúc thành một lời giải thích một câu không hưởng lợi từ một bước suy luận. Chế độ tư duy sẽ thêm 300-800 ms độ trễ để đổi lấy một cải thiện chất lượng mà chúng tôi không thể đo được. Chúng tôi đã thử cả hai. Đầu ra không-tư-duy không thể phân biệt được về chất lượng và nhanh hơn khoảng 3 lần.

Ghi chú nội bộ của chúng tôi ghim ưu tiên này một cách rõ ràng. Môi trường sản xuất chạy `gemini-2.5-flash-lite` với chế độ tư duy tắt; dev và test luôn giả lập LLM hoàn toàn qua `AGENT_STUB_LLM=true` để bộ khung không bao giờ tính phí token. Mặc định này được thêm vào sau khi một phiên bản đầu của trợ lý vô tình bị trỏ tới một biến thể chế độ tư duy và độ trễ trên khung soạn thảo tăng gấp đôi qua đêm. Cách khắc phục là một thay đổi cấu hình một dòng. Bài học bền vững: đối với các công việc của chúng tôi, suy luận là chi phí thừa.

Những gì chúng tôi đang đánh đổi

Công bố trung thực về sự đánh đổi này. Bằng cách không dùng một mô hình đầu bảng, chúng tôi đang từ bỏ một chút năng lực biên trên những câu lệnh mơ hồ nhất. Một người dùng gõ vào ô soạn thảo điều gì đó thực sự khó hiểu có thể nhận được một câu hỏi làm rõ hơi kém hơn từ Flash Lite so với từ GPT-5. Chúng tôi cũng đang từ bỏ quyền truy cập vào một số tính năng nâng cao mà tầng đầu bảng cung cấp — cửa sổ ngữ cảnh triệu token, các chuỗi gọi công cụ phức tạp, suy luận đa phương thức chuyên sâu — không có cái nào trong số đó quan trọng với các tác vụ của chúng tôi nhưng chúng sẽ quan trọng nếu có bao giờ chúng tôi mở rộng phạm vi của mô hình. (Chúng tôi sẽ không, theo bài viết trước trong loạt bài này.)

Những đánh đổi mà chúng tôi không thực hiện: chúng tôi không từ bỏ độ chính xác phân tích cú pháp trên trường hợp phổ biến, chúng tôi không từ bỏ chất lượng thuyết minh, chúng tôi không từ bỏ độ trễ, chúng tôi không từ bỏ tính dự đoán được của chi phí. Từ 0,2 đến 0,5 điểm phần trăm năng lực biên mà chúng tôi mất khi chọn một mô hình nhanh thay vì một mô hình đầu bảng là cái giá mà chúng tôi vui lòng trả.

Khi nào chúng tôi sẽ xem xét lại

Một vài điều kiện cụ thể sẽ khiến chúng tôi mở lại việc lựa chọn mô hình một lần nữa.

Nếu độ trễ của Flash Lite suy giảm đáng kể — chẳng hạn, p95 leo lên trên 600 ms trong giờ cao điểm và duy trì như vậy hơn một tuần — thì ngân sách độ trễ bị phá vỡ và chúng tôi chuyển đổi. Bộ khung đánh giá của chúng tôi chạy liên tục đối với cả bốn mô hình trong danh sách rút gọn với đúng mẫu câu lệnh của chúng tôi, nên chúng tôi luôn có các số liệu hiện thời vào mọi lúc.

Nếu chúng tôi bổ sung hỗ trợ đa ngôn ngữ và chất lượng của Flash Lite giảm nhiều hơn các mô hình tầng nhanh khác trên các ngôn ngữ cụ thể mà chúng tôi thêm vào (Tiếng Tây Ban Nha, Tiếng Nga, Tiếng Trung là đầu tiên), chúng tôi có thể chuyển sang đa nhà cung cấp — Gemini cho luồng tiếng Anh chính và một mô hình khác cho các ngôn ngữ mà nó hoạt động kém hơn. Tầng tác nhân đã hỗ trợ định tuyến này rồi.

Nếu giá cả thay đổi đáng kể — chẳng hạn Google tăng giá Flash Lite gấp 5 lần hoặc một đối thủ giảm xuống còn một phần mười — chúng tôi xem xét lại trục chi phí. Chúng tôi sẽ không chuyển đổi vì chênh lệch giá 10%, nhưng một sự dịch chuyển mang tính cấu trúc thì có ý nghĩa.

Nếu một mô hình mới từ một nhà cung cấp khác vượt trội rõ ràng so với Flash Lite trên bộ đánh giá cụ thể của chúng tôi (điểm chuẩn phân tích cú pháp và điểm chuẩn thuyết minh trên các câu lệnh sản xuất thực tế của chúng tôi, không phải các bảng xếp hạng chung chung), chúng tôi chuyển đổi. Chúng tôi chạy bộ đánh giá hàng tháng. Lần gần nhất chúng tôi làm vậy, Flash Lite thắng ở mọi ô liên quan — và đó chính là cách chúng tôi đi đến đây ngay từ đầu.

Bài học tổng quát

Việc chọn một mô hình là một quyết định phụ thuộc vào khối lượng công việc, không phải một quyết định về thương hiệu. Mô hình "tốt nhất" cho một sản phẩm phụ thuộc vào hình dạng của các câu lệnh bạn đang gửi, ngân sách độ trễ bạn có, kỷ luật đầu ra có cấu trúc bạn cần, mức chi phí ở quy mô của bạn, và lập trường của nhà cung cấp mà bạn có thể chấp nhận. Không điều nào trong số đó hiển thị trên một bảng xếp hạng. Tất cả chúng đều phải được đo lường dựa trên khối lượng công việc thực tế của bạn — và đo lại định kỳ, bởi các nhà cung cấp cho ra các mô hình tầng nhanh mới sau mỗi vài tháng và câu trả lời có thể thay đổi.

Với hình dạng của Cambio — các câu lệnh ngắn đối xứng, ngân sách độ trễ nghiêm ngặt, hai tác vụ hẹp không cần suy luận — Gemini 2.5 Flash Lite là câu trả lời đúng vào lúc này. Với một sản phẩm khác có hình dạng khác, câu trả lời đúng thực sự khác. Nếu bạn đang xây dựng bất cứ thứ gì tương tự, điều rút ra không phải là "hãy dùng Gemini Flash Lite." Mà là "hãy xây dựng một tầng tác nhân không phụ thuộc nhà cung cấp, kiểm thử tầng nhanh dựa trên khối lượng công việc thực tế của bạn, và chạy lại bài kiểm thử mỗi quý."

Bài cuối cùng trong loạt bài đi sâu hơn mọi bài trước: cách các giao dịch hoán đổi liên chuỗi trên Cambio hoạt động mà không cần hợp đồng cầu nối, và vì sao đó là một đặc điểm vận hành khác với các kiến trúc mà phần lớn ngành đang dùng cho cùng công việc.

Thêm bài viết

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites
Research

What $200 and $1,000 of BTC → USDT on Tron really cost: 716 checks of five exchanges’ own websites

Đọc →
Tỷ giá cố định và tỷ giá thả nổi: Nên chọn loại nào?
Kiến thức

Tỷ giá cố định và tỷ giá thả nổi: Nên chọn loại nào?

Đọc →
Cách xác minh địa chỉ ví trước mỗi lần hoán đổi
Bảo mật

Cách xác minh địa chỉ ví trước mỗi lần hoán đổi

Đọc →

// SẴN SÀNG

Thử một giao dịch hoán đổi. AI sẽ tự giải thích.

Bắt đầu hoán đổi →