
WalseGemini 3.6 Flash adalah model andalan baru Google. Model ini tersedia secara umum pada 21 Juli 2026,...
Gemini 3.6 Flash adalah model andalan baru Google. Model ini tersedia secara umum pada 21 Juli 2026, lebih murah, dan lebih efisien token dibandingkan Gemini 3.5 Flash yang digantikannya. Jika Anda menangani lalu lintas API bervolume tinggi dan membutuhkan kualitas solid tanpa biaya model unggulan, model ini ditujukan untuk kebutuhan tersebut.
Panduan ini menjelaskan perubahan dari Gemini 3.5 Flash, spesifikasi, harga, hasil tolok ukur, serta cara mengakses dan menguji panggilan API Gemini 3.6 Flash sebelum memigrasikan trafik produksi.
Gemini 3.6 Flash adalah model tingkat menengah berdaya pemrosesan tinggi dalam keluarga Gemini Google. Model ini dioptimalkan untuk beban kerja produksi sehari-hari, seperti:
Google merilis model ini bersama dua model lain pada 21 Juli 2026:
Baca juga:
Perhatikan penamaan modelnya. Model andalan menggunakan versi 3.6, sementara Flash-Lite dan Flash Cyber tetap menggunakan 3.5.
gemini-3.6-flash
gemini-3.5-flash-lite
Keduanya adalah model dan tingkatan berbeda, bukan salah ketik. Pastikan ID model pada konfigurasi aplikasi dan pipeline CI/CD Anda sudah benar.
Google menerbitkan pengumuman di blog Google. Kartu model tersedia di halaman DeepMind Flash.
Perubahan utamanya adalah efisiensi token dan biaya keluaran.
Efisiensi token penting untuk aplikasi agentik. Setiap token keluaran, langkah penalaran, dan panggilan alat tambahan menambah biaya serta latensi. Untuk beban kerja dengan volume tinggi, pengurangan kecil per permintaan dapat berdampak besar pada total tagihan.
Sebelum memindahkan trafik dari model lama, bandingkan hasil untuk prompt, konteks, dan format keluaran yang benar-benar digunakan aplikasi Anda. Lihat juga Gemini 3.6 Flash vs Gemini 3.5 Flash.
| Atribut | Gemini 3.6 Flash |
|---|---|
| ID model | gemini-3.6-flash |
| Jendela konteks masukan | 1 juta token |
| Keluaran maksimum | 64 ribu token |
| Modalitas masukan | Teks, gambar, video, audio, PDF |
| Keluaran | Hanya teks |
| Harga masukan | $1,50 per 1 juta token |
| Harga keluaran | $7,50 per 1 juta token, termasuk token berpikir |
| Tingkat gratis | Ya, melalui Google AI Studio dengan batas laju |
| Tanggal peluncuran | 21 Juli 2026 |
Jendela konteks 1 juta token memungkinkan Anda mengirim dokumen besar, transkrip panjang, atau basis kode dalam satu permintaan. Namun, batas keluaran tetap 64 ribu token per respons.
Jika aplikasi perlu menghasilkan konten yang lebih panjang, pecah pekerjaan menjadi beberapa tahap:
Tolok ukur bukan jaminan performa aplikasi Anda, tetapi berguna untuk menentukan area penggunaan yang paling sesuai.
Gemini 3.6 Flash mencatat hasil berikut:
Hasil tersebut menunjukkan model ini relevan untuk tugas seperti analisis bug, pembuatan patch, bantuan terminal, dan alur kerja rekayasa perangkat lunak.
Pada OSWorld-Verified, Gemini 3.6 Flash mencapai 83,0%, naik dari 78,4% pada Gemini 3.5 Flash.
Peningkatan ini penting untuk agen yang berinteraksi dengan desktop, browser, atau aplikasi melalui antarmuka pengguna nyata.
Model mencatat Elo GDPVal-AA v2 sebesar 1421. GDPVal mengukur kinerja pada tugas profesional dunia nyata. Skor Elo yang lebih tinggi berarti model memenangkan lebih banyak perbandingan head-to-head.
Untuk pengambilan informasi dari konteks panjang:
Jangan mengasumsikan model akan mengingat semua detail saat konteks mendekati batas maksimum. Uji skenario retrieval Anda sendiri pada panjang dokumen yang sebenarnya digunakan di produksi.
Gemini 3.6 Flash berharga:
Harga keluaran mencakup token berpikir. Artinya, penalaran internal yang tidak muncul dalam jawaban akhir tetap dihitung dalam penggunaan token.
Untuk caching konteks:
Caching berguna jika aplikasi sering mengirim prompt besar yang sama, misalnya instruksi sistem, dokumentasi produk, atau konteks basis kode.
Tersedia tingkat gratis melalui Google AI Studio, tetapi tingkat tersebut dibatasi laju dan Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya. Gunakan tingkat gratis untuk prototipe, bukan trafik produksi sensitif.
Referensi tambahan:
Anda dapat mengakses Gemini 3.6 Flash melalui beberapa jalur:
Bagi pengembang, Gemini API adalah jalur utama. Setelah memperoleh API key, panggil model dengan ID berikut:
gemini-3.6-flash
Contoh struktur permintaan REST:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent?key=$GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [
{
"parts": [
{
"text": "Ringkas dokumen ini dalam tiga poin."
}
]
}
]
}'
Simpan API key dalam variabel lingkungan, bukan langsung di source code:
export GEMINI_API_KEY="your-api-key"
Untuk panduan implementasi lebih lengkap, baca:
Pilih model berdasarkan biaya, latensi, dan tingkat kualitas yang diperlukan.
| Model | Kapan digunakan |
|---|---|
| Gemini 3.5 Flash-Lite | Trafik sangat tinggi, sensitif terhadap latensi, dan tugas yang lebih sederhana |
| Gemini 3.6 Flash | Tugas umum produksi, coding, agentik, dan kebutuhan kualitas lebih tinggi |
| Gemini 3.5 Flash Cyber | Kebutuhan keamanan berpagar untuk pemerintah dan mitra tepercaya |
Gemini 3.5 Flash-Lite berharga $0,30 untuk masukan dan $2,50 untuk keluaran per juta token. Model ini juga cepat, sekitar 350 token keluaran per detik.
Gunakan Flash-Lite ketika biaya dan latensi lebih penting daripada kualitas maksimal. Gunakan Gemini 3.6 Flash saat tugas memerlukan keluaran lebih andal, penalaran lebih baik, atau kemampuan agentik yang lebih kuat.
Gemini 3.5 Pro belum dirilis secara publik. Google menyatakan masih mengujinya dengan mitra. Google juga mengisyaratkan pengujian pra-pelatihan Gemini 4, tetapi itu belum berarti model tersebut dapat dipanggil melalui API hari ini.
Untuk konteks generasi sebelumnya, baca apa itu Gemini 3.5.
Angka tolok ukur tidak menggantikan pengujian pada prompt dan data Anda sendiri. Sebelum memigrasikan trafik, buat pengujian regresi untuk memvalidasi:
Apidog adalah klien API dan platform pengujian yang dapat digunakan untuk mengirim, memvalidasi, dan menjadwalkan panggilan Gemini API.
Buat permintaan POST ke endpoint Gemini API dan gunakan model berikut:
gemini-3.6-flash
Tambahkan header:
Content-Type: application/json
Jangan tempel API key ke URL atau koleksi permintaan. Buat variabel lingkungan, misalnya:
GEMINI_API_KEY
Dengan cara ini, Anda dapat berpindah antara key pengembangan, staging, dan produksi tanpa mengubah definisi permintaan.
Setelah mengirim permintaan, tambahkan assertion untuk memastikan respons tetap sesuai kontrak aplikasi Anda.
Contoh yang perlu diuji:
- Status code adalah 200
- Respons memiliki content
- Respons memiliki parts
- parts berisi text
- Text tidak kosong
Jika pembaruan model mengubah bentuk respons atau menghasilkan payload yang tidak sesuai harapan, pengujian harus gagal secara eksplisit.
Simpan permintaan untuk prompt penting, misalnya:
Kemudian jadwalkan pengujian API agar berjalan secara berkala.
Apidog tidak menjalankan model dan bukan kerangka kerja AI. Perannya adalah membantu Anda membangun permintaan, mengirimkannya, serta memverifikasi respons terhadap standar yang Anda tetapkan.
Saat Google merilis pembaruan model berikutnya, pengujian tersimpan dapat menunjukkan dengan cepat apakah ada perubahan pada respons, skema, atau latensi yang diandalkan aplikasi Anda. Unduh Apidog untuk menyiapkan permintaan pertama Anda.
Ada tingkat gratis melalui Google AI Studio, tetapi dibatasi laju dan ditujukan untuk pembuatan prototipe. Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya. Untuk trafik produksi, biayanya $1,50 per juta token masukan dan $7,50 per juta token keluaran.
Untuk sebagian besar pekerjaan, ya. Model ini menggunakan sekitar 17% lebih sedikit token keluaran, harga keluaran turun dari $9,00 menjadi $7,50 per juta token, serta memiliki hasil lebih kuat pada pengkodean dan penggunaan komputer. Pada OSWorld-Verified, skornya naik dari 78,4% menjadi 83,0%.
Belum. Google menyatakan Gemini 3.5 Pro masih diuji bersama mitra, sehingga belum ada model Pro publik dalam rilis ini.
Gunakan:
gemini-3.6-flash
Jangan tertukar dengan:
gemini-3.5-flash-lite
Flash-Lite adalah tingkatan yang berbeda dan lebih murah.
Gemini 3.6 Flash hanya menghasilkan teks. Model ini dapat menerima gambar, audio, video, dan PDF sebagai masukan, tetapi tidak menghasilkan media tersebut sebagai keluaran.
Selain itu, akurasi pengambilan informasi menurun saat konteks mendekati 1 juta token. Uji prompt dan panjang konteks produksi Anda sendiri sebelum mengandalkan konteks maksimum.
Gemini 3.6 Flash adalah pilihan utama untuk sebagian besar trafik Gemini API yang membutuhkan biaya rendah, efisiensi token, dan kemampuan agentik yang lebih baik dibandingkan model sebelumnya. Sebelum migrasi skala besar, buat dan jalankan pengujian regresi pada prompt yang benar-benar penting bagi aplikasi Anda.