Kebanyakan produk yang menempatkan sebuah model di balik permukaan chat pada tahun 2026 langsung meraih model garda depan tercerdas yang tersedia. Cambio berjalan di atas Gemini 2.5 Flash Lite. Berikut adalah tradeoff rekayasa sesungguhnya yang menuntun ke pilihan itu — termasuk periode yang kami habiskan pada model tier-cepat lain terlebih dahulu — dan kondisi yang akan membuat kami mengubah pikiran lagi.
Ketika Anda memutuskan untuk menempatkan model bahasa di balik permukaan produk pada tahun 2026, default yang paling lantang adalah menggunakan model garda depan mana pun yang memiliki skor tertinggi pada papan peringkat bulan ini. Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra — inilah nama-nama yang muncul ketika tim produk mendiskusikan "AI mana." Lebih cerdas itu lebih baik, begitu penalarannya, dan selisih biayanya lenyap pada skala besar.
Cambio berjalan di atas Gemini 2.5 Flash Lite. Bukan varian penalaran, bukan varian garda depan — model tier-cepat terkecil yang dikirimkan Google, duduk di bawah Flash dan jauh di bawah Pro. Kami membuat keputusan itu dengan sengaja, setelah mengevaluasi alternatif-alternatif yang jelas dan menjalankan model tier-cepat sebelumnya (grok-4-1-fast milik xAI) di produksi selama beberapa minggu. Postingan ini adalah penalaran rekayasa sesungguhnya di balik pilihan saat ini, kondisi yang mendorongnya, dan kondisi yang akan membuat kami meninjau ulang lagi.
Apa yang harus dilakukan model di Cambio
Dua pekerjaan, keduanya terbatas. Tidak satu pun yang berat penalaran.
Yang pertama adalah parsing. Model mengambil pesan pengguna yang singkat — biasanya 5 hingga 30 kata — dan mengekstrak bidang-bidang terstruktur: category (Swap, Execute, Suggest, Compare, Help, Explore), from-currency, from-network, to-currency, to-network, amount, direction. Sebagian besar kasus ditangani oleh lapisan regex yang berjalan tanpa model. Model dipanggil ketika regex ragu. Outputnya adalah objek JSON dengan paling banyak tujuh bidang.
Yang kedua adalah narasi. Model menerima objek quote terstruktur dan menghasilkan penjelasan singkat dalam bahasa yang sederhana. Model tidak boleh menulis harga, nilai tukar, atau jumlah; kartu quote yang memuat setiap angka. Outputnya satu atau dua kalimat pendek, tidak pernah lebih dari 40 kata.
Tidak satu pun pekerjaan melibatkan penalaran multi-langkah. Tidak satu pun pekerjaan mengharuskan model memilih di antara banyak alternatif. Tidak satu pun pekerjaan membuat model berinteraksi dengan alat, memanggil API, atau menyimpan state lintas giliran. Persyaratan kapabilitasnya adalah: membaca prompt singkat, mengikuti format output terstruktur, menghasilkan bahasa Inggris yang koheren. Setiap model bahasa modern dapat melakukan ini, termasuk yang diluncurkan dua atau tiga tahun lalu.
Mengapa model penalaran garda depan adalah alat yang salah di sini
Ketika kami membandingkan para kandidat, kami menjalankan batch eval identik terhadap Claude Opus 4.7, GPT-5, Gemini 2.5 Pro Ultra, dan Gemini 2.5 Flash Lite. Plafon kapabilitas pada ketepatan parse dan kualitas narasi mentok di sekitar 99,4-99,6% pada setiap model. Model garda depan mendapat skor sedikit lebih tinggi pada prompt yang paling ambigu — jenis di mana pesannya memang benar-benar tidak jelas — tetapi keuntungan marginalnya hanya beberapa persepuluh persen pada beban kerja yang sudah memiliki pra-filter regex yang menangani 95% mudahnya.
Gambaran biayanya kurang marginal. Per satu juta token, model penalaran garda depan pada tahun 2026 dihargai kira-kira 8x hingga 20x varian cepat. Gambaran latensinya bahkan kurang marginal lagi. Latensi token-pertama P95 pada Claude Opus berada di rentang 800-1500 md; pada GPT-5 di 600-1100 md; pada Gemini 2.5 Flash Lite di 120-300 md. Untuk sebuah produk di mana total perjalanan pulang-pergi composer seharusnya di bawah 200 milidetik, sebuah model yang membutuhkan 600 md untuk memulai token pertamanya secara struktural tidak kompatibel.
Tingkat parse 99,5% pada 200 md adalah produk yang lebih baik daripada tingkat parse 99,7% pada 800 md. Kurva pengalaman pengguna didominasi oleh latensi dalam rentang tempat kami beroperasi. Begitu model cukup cepat dan cukup benar, tambahan "kecerdasan" adalah anggaran yang terbuang.
Mengapa tier cepat secara umum
Daftar pendek model yang layak untuk pekerjaan Cambio berasal dari tier cepat lintas penyedia: Claude Haiku 4.5, GPT-5 Mini, Gemini 2.5 Flash Lite, grok-4-1-fast. Keempatnya cukup mampu pada benchmark parsing dan narasi. Keempatnya cukup cepat untuk masuk ke anggaran latensi kami. Keempatnya cukup murah sehingga biaya per-quote dapat diabaikan pada volume peluncuran kami.
Pada titik itu, keputusannya lebih sedikit tentang kapabilitas model dan lebih banyak tentang kecocokan operasional. Kami mengevaluasi empat sumbu: biaya per quote pada volume peluncuran, keandalan output terstruktur, latensi di bawah beban penyedia yang realistis, dan kesehatan praktis dari SDK penyedia serta postur rate-limit-nya.
Mengapa Gemini 2.5 Flash Lite secara spesifik
Soal biaya: Flash Lite adalah yang termurah dari keempatnya pada campuran token input/output spesifik kami. Panggilan parse Cambio adalah input singkat, output singkat, dan harga per-juta Flash Lite pada pola singkat/singkat simetris ini mengalahkan Haiku, GPT-5 Mini, dan grok-4-1-fast sebesar ~20–60% pada level per-panggilan. Pada volume peluncuran selisih absolutnya hanya beberapa dolar per hari di keempatnya; pada volume pasca-peluncuran yang diproyeksikan, selisihnya berarti.
Soal keandalan output terstruktur: mode JSON `responseSchema` milik Google adalah yang paling disiplin dari keempatnya. Kami mengukur seberapa sering setiap model mengembalikan objek JSON yang dapat di-parse dan cocok dengan skema kami pada percobaan pertama untuk template prompt persis kami. Flash Lite seri dengan Haiku di puncak (>99,5%); grok-4-1-fast tepat di belakang (~99,3%); GPT-5 Mini tertinggal (~97,8%). Selisih 1,7 poin persentase antara puncak dan dasar adalah uang sungguhan — setiap output yang cacat adalah sebuah percobaan ulang, yang menggandakan latensi bagi pengguna itu.
Soal latensi di bawah beban penyedia: Google memiliki jejak penyajian terbesar di antara keempat penyedia. Latensi token-pertama P99 pada Flash Lite tetap di bawah 350 md selama jam kerja AS dalam uji beban kami, tanpa kontensi antrean yang terukur. Ketiga penyedia lainnya semuanya menunjukkan lonjakan dingin 5–15 detik selama jendela lalu lintas tinggi dalam enam bulan terakhir. Kami tidak berargumen bahwa model dasarnya lebih lambat; kami berargumen bahwa postur kontensi secara material lebih baik pada infrastruktur Google.
Soal proses produksi sebelumnya: kami merilis versi pertama Cambio di grok-4-1-fast dan menjalankannya selama beberapa minggu. Ia berfungsi. Peralihan ke Flash Lite (commit pada 2026-05-27) bukan karena Grok salah — itu karena Gemini terukur lebih baik pada keempat sumbu di atas ketika kami menjalankan ulang rangkaian eval. Lapisan agen bersifat agnostik-penyedia: xAI dan OpenAI masih dapat dipilih di balik sebuah flag konfigurasi, dan test harness terus menstub semuanya. Jika Gemini pernah mengalami regresi, kami bisa beralih kembali dalam satu perubahan konfigurasi.
Mengapa bukan varian penalaran
Gemini 2.5 mengirimkan sebuah varian mode-berpikir. Kami tidak menggunakannya. Mode berpikir dirancang untuk masalah yang diuntungkan oleh chain-of-thought — masalah multi-langkah, masalah di mana model harus mempertimbangkan alternatif, masalah di mana langkah-langkah scratch-pad antara memperbaiki jawaban akhir.
Tidak satu pun dari dua pekerjaan kami seperti itu. Mem-parsing pesan pengguna singkat menjadi tujuh bidang terstruktur tidak diuntungkan oleh langkah penalaran. Menarasikan objek quote terstruktur menjadi penjelasan satu kalimat tidak diuntungkan oleh langkah penalaran. Mode berpikir akan menambah 300-800 md latensi untuk peningkatan kualitas yang tidak dapat kami ukur. Kami menguji keduanya. Output non-berpikir tak terbedakan kualitasnya dan ~3x lebih cepat.
Catatan internal kami menyematkan preferensi ini secara eksplisit. Produksi menjalankan `gemini-2.5-flash-lite` dengan berpikir dimatikan; dev dan test selalu menstub LLM sepenuhnya via `AGENT_STUB_LLM=true` sehingga harness tidak pernah menagih token. Default ini ditambahkan setelah versi awal asisten tidak sengaja diarahkan ke varian mode-berpikir dan latensi pada composer berlipat dua dalam semalam. Perbaikannya adalah perubahan konfigurasi satu baris. Pelajarannya bertahan lama: untuk pekerjaan kami, penalaran adalah beban tambahan.
Apa yang kami korbankan
Pengungkapan jujur soal trade-off ini. Dengan tidak memakai model frontier, kami mengorbankan sedikit kemampuan marginal pada prompt yang paling ambigu. Pengguna yang mengetik sesuatu yang benar-benar membingungkan ke composer mungkin mendapat pertanyaan klarifikasi yang sedikit lebih buruk dari Flash Lite dibanding dari GPT-5. Kami juga mengorbankan akses ke sejumlah fitur canggih yang ditawarkan tier frontier — jendela konteks sejuta token, rantai tool-calling yang kompleks, penalaran multimodal yang mendalam — yang tidak satu pun relevan untuk pekerjaan kami, tetapi akan penting jika suatu saat kami memperluas cakupan model. (Kami tidak akan melakukannya, sesuai tulisan sebelumnya dalam seri ini.)
Trade-off yang tidak kami lakukan: kami tidak mengorbankan ketepatan parsing pada kasus umum, tidak mengorbankan kualitas narasi, tidak mengorbankan latensi, tidak mengorbankan prediktabilitas biaya. Kemampuan marginal sebesar 0,2-0,5 poin persentase yang kami korbankan dengan memilih model cepat ketimbang model frontier adalah harga yang dengan senang hati kami bayar.
Kapan kami akan meninjaunya kembali
Ada beberapa kondisi spesifik yang akan membuat kami membuka kembali pilihan model.
Jika latensi Flash Lite memburuk secara signifikan — misalnya, p95 naik di atas 600 ms pada jam sibuk dan bertahan di sana lebih dari seminggu — anggaran latensi jebol dan kami beralih. Harness evaluasi kami berjalan terus-menerus terhadap keempat model shortlist dengan template prompt kami yang persis sama, jadi kami selalu punya angka terkini setiap saat.
Jika kami menambah dukungan multibahasa dan kualitas Flash Lite turun lebih besar dibanding model fast-tier lain pada bahasa spesifik yang kami tambahkan (Spanyol, Rusia, Mandarin lebih dulu), kami mungkin beralih ke multi-provider — Gemini untuk jalur utama bahasa Inggris dan model berbeda untuk bahasa di mana performanya kurang. Lapisan agen sudah mendukung routing seperti ini.
Jika harga berubah secara substansial — misalnya Google menaikkan tarif Flash Lite 5x atau kompetitor memangkas hingga sepersepuluh — kami meninjau ulang sumbu biaya. Kami tidak akan beralih hanya untuk selisih harga 10%, tetapi pergeseran struktural itu penting.
Jika ada model baru dari provider lain yang jelas mengalahkan Flash Lite pada eval suite spesifik kami (benchmark parsing dan benchmark narasi pada prompt produksi kami yang sebenarnya, bukan leaderboard generik), kami beralih. Kami menjalankan eval suite setiap bulan. Terakhir kali kami lakukan, Flash Lite menang di setiap sel yang relevan — dan itulah yang membuat kami sampai di sini sejak awal.
Pelajaran umumnya
Memilih model adalah keputusan spesifik-beban-kerja, bukan keputusan merek. Model "terbaik" untuk sebuah produk bergantung pada bentuk prompt yang Anda kirim, anggaran latensi yang Anda punya, disiplin structured-output yang Anda butuhkan, amplop biaya pada skala Anda, dan postur provider yang bisa Anda terima. Tidak satu pun hal itu terlihat dalam leaderboard. Semuanya harus diukur terhadap beban kerja Anda yang sebenarnya — dan diukur ulang secara berkala, karena provider merilis model fast-tier baru setiap beberapa bulan dan jawabannya bisa berubah.
Untuk bentuk Cambio — prompt simetris yang pendek, anggaran latensi yang ketat, dua pekerjaan sempit yang tidak butuh penalaran — Gemini 2.5 Flash Lite adalah jawaban yang tepat hari ini. Untuk produk berbeda dengan bentuk berbeda, jawaban yang tepat benar-benar berbeda. Jika Anda sedang membangun sesuatu yang serupa, intinya bukan "pakai Gemini Flash Lite." Intinya adalah "bangun lapisan agen yang provider-agnostik, uji fast tier terhadap beban kerja Anda yang sebenarnya, dan jalankan ulang pengujian setiap kuartal."
Tulisan terakhir dalam seri ini membahas lebih dalam daripada tulisan-tulisan sebelumnya: bagaimana swap lintas chain di Cambio bekerja tanpa kontrak bridge, dan mengapa itu merupakan profil operasional yang berbeda dari arsitektur yang dipakai sebagian besar industri untuk tugas yang sama.



