Apa Itu Gemini 3.6 Flash

Apa Itu Gemini 3.6 Flash

Apa Itu Gemini 3.6 FlashWalse

Gemini 3.6 Flash adalah model andalan baru Google. Model ini tersedia secara umum pada 21 Juli 2026,...

Gemini 3.6 Flash adalah model andalan baru Google. Model ini tersedia secara umum pada 21 Juli 2026, lebih murah, dan lebih efisien token dibandingkan Gemini 3.5 Flash yang digantikannya. Jika Anda menangani lalu lintas API bervolume tinggi dan membutuhkan kualitas solid tanpa biaya model unggulan, model ini ditujukan untuk kebutuhan tersebut.

Coba Apidog hari ini

Panduan ini menjelaskan perubahan dari Gemini 3.5 Flash, spesifikasi, harga, hasil tolok ukur, serta cara mengakses dan menguji panggilan API Gemini 3.6 Flash sebelum memigrasikan trafik produksi.

Apa itu Gemini 3.6 Flash?

Gemini 3.6 Flash adalah model tingkat menengah berdaya pemrosesan tinggi dalam keluarga Gemini Google. Model ini dioptimalkan untuk beban kerja produksi sehari-hari, seperti:

  • Merangkum dokumen
  • Mengekstraksi data terstruktur
  • Klasifikasi teks
  • Chatbot
  • Panggilan alat multi-langkkah
  • Analisis teks, gambar, video, audio, dan PDF dalam satu permintaan

Gemini 3.6 Flash

Google merilis model ini bersama dua model lain pada 21 Juli 2026:

  • Gemini 3.5 Flash-Lite: opsi lebih murah dan cepat untuk pekerjaan bervolume tinggi.
  • Gemini 3.5 Flash Cyber: model keamanan berpagar (gated) untuk pemerintah dan mitra tepercaya.

Baca juga:

Jajaran model Gemini Flash

Perhatikan penamaan modelnya. Model andalan menggunakan versi 3.6, sementara Flash-Lite dan Flash Cyber tetap menggunakan 3.5.

gemini-3.6-flash
gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Keduanya adalah model dan tingkatan berbeda, bukan salah ketik. Pastikan ID model pada konfigurasi aplikasi dan pipeline CI/CD Anda sudah benar.

Google menerbitkan pengumuman di blog Google. Kartu model tersedia di halaman DeepMind Flash.

Apa yang baru dibandingkan Gemini 3.5 Flash?

Perubahan utamanya adalah efisiensi token dan biaya keluaran.

  • Gemini 3.6 Flash menggunakan sekitar 17% lebih sedikit token keluaran untuk menyelesaikan pekerjaan yang sama.
  • Harga keluaran turun dari $9,00 menjadi $7,50 per 1 juta token.
  • Model ini lebih baik dalam pengkodean, penggunaan komputer, penalaran multi-langkah, dan panggilan alat.

Efisiensi token penting untuk aplikasi agentik. Setiap token keluaran, langkah penalaran, dan panggilan alat tambahan menambah biaya serta latensi. Untuk beban kerja dengan volume tinggi, pengurangan kecil per permintaan dapat berdampak besar pada total tagihan.

Sebelum memindahkan trafik dari model lama, bandingkan hasil untuk prompt, konteks, dan format keluaran yang benar-benar digunakan aplikasi Anda. Lihat juga Gemini 3.6 Flash vs Gemini 3.5 Flash.

Spesifikasi Gemini 3.6 Flash

Atribut Gemini 3.6 Flash
ID model gemini-3.6-flash
Jendela konteks masukan 1 juta token
Keluaran maksimum 64 ribu token
Modalitas masukan Teks, gambar, video, audio, PDF
Keluaran Hanya teks
Harga masukan $1,50 per 1 juta token
Harga keluaran $7,50 per 1 juta token, termasuk token berpikir
Tingkat gratis Ya, melalui Google AI Studio dengan batas laju
Tanggal peluncuran 21 Juli 2026

Jendela konteks 1 juta token memungkinkan Anda mengirim dokumen besar, transkrip panjang, atau basis kode dalam satu permintaan. Namun, batas keluaran tetap 64 ribu token per respons.

Jika aplikasi perlu menghasilkan konten yang lebih panjang, pecah pekerjaan menjadi beberapa tahap:

  1. Bagi dokumen atau tugas menjadi beberapa bagian.
  2. Buat hasil per bagian.
  3. Kirim hasil tersebut ke panggilan lanjutan untuk sintesis akhir.
  4. Simpan setiap hasil antara untuk audit dan debugging.

Bagaimana performanya?

Tolok ukur bukan jaminan performa aplikasi Anda, tetapi berguna untuk menentukan area penggunaan yang paling sesuai.

Pengkodean

Gemini 3.6 Flash mencatat hasil berikut:

  • 58,7% pada SWE-Bench Pro
  • 49% pada DeepSWE v1.1
  • 78,0% pada Terminal-bench 2.1

Hasil tersebut menunjukkan model ini relevan untuk tugas seperti analisis bug, pembuatan patch, bantuan terminal, dan alur kerja rekayasa perangkat lunak.

Penggunaan komputer

Pada OSWorld-Verified, Gemini 3.6 Flash mencapai 83,0%, naik dari 78,4% pada Gemini 3.5 Flash.

Peningkatan ini penting untuk agen yang berinteraksi dengan desktop, browser, atau aplikasi melalui antarmuka pengguna nyata.

Kualitas umum

Model mencatat Elo GDPVal-AA v2 sebesar 1421. GDPVal mengukur kinerja pada tugas profesional dunia nyata. Skor Elo yang lebih tinggi berarti model memenangkan lebih banyak perbandingan head-to-head.

Konteks panjang

Untuk pengambilan informasi dari konteks panjang:

  • Pada 128 ribu token, rata-rata pengambilan mencapai 91,8%.
  • Pada jendela penuh 1 juta token, akurasi pengambilan titik demi titik turun menjadi 54,0%.

Jangan mengasumsikan model akan mengingat semua detail saat konteks mendekati batas maksimum. Uji skenario retrieval Anda sendiri pada panjang dokumen yang sebenarnya digunakan di produksi.

Sekilas harga

Gemini 3.6 Flash berharga:

  • $1,50 per 1 juta token masukan
  • $7,50 per 1 juta token keluaran

Harga keluaran mencakup token berpikir. Artinya, penalaran internal yang tidak muncul dalam jawaban akhir tetap dihitung dalam penggunaan token.

Untuk caching konteks:

  • $0,15 per 1 juta token
  • $1,00 per 1 juta token per jam penyimpanan

Caching berguna jika aplikasi sering mengirim prompt besar yang sama, misalnya instruksi sistem, dokumentasi produk, atau konteks basis kode.

Tersedia tingkat gratis melalui Google AI Studio, tetapi tingkat tersebut dibatasi laju dan Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya. Gunakan tingkat gratis untuk prototipe, bukan trafik produksi sensitif.

Referensi tambahan:

Cara mengakses Gemini 3.6 Flash

Anda dapat mengakses Gemini 3.6 Flash melalui beberapa jalur:

  • Gemini API melalui Google AI Studio
  • Google Antigravity, platform pengembangan agentik Google
  • Gemini Enterprise Agent Platform untuk tim yang membangun agen terkelola
  • Aplikasi Gemini untuk penggunaan chat langsung

Bagi pengembang, Gemini API adalah jalur utama. Setelah memperoleh API key, panggil model dengan ID berikut:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Contoh struktur permintaan REST:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent?key=$GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "Ringkas dokumen ini dalam tiga poin."
          }
        ]
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Simpan API key dalam variabel lingkungan, bukan langsung di source code:

export GEMINI_API_KEY="your-api-key"
Enter fullscreen mode Exit fullscreen mode

Untuk panduan implementasi lebih lengkap, baca:

Posisi dalam jajaran produk Google

Pilih model berdasarkan biaya, latensi, dan tingkat kualitas yang diperlukan.

Model Kapan digunakan
Gemini 3.5 Flash-Lite Trafik sangat tinggi, sensitif terhadap latensi, dan tugas yang lebih sederhana
Gemini 3.6 Flash Tugas umum produksi, coding, agentik, dan kebutuhan kualitas lebih tinggi
Gemini 3.5 Flash Cyber Kebutuhan keamanan berpagar untuk pemerintah dan mitra tepercaya

Gemini 3.5 Flash-Lite berharga $0,30 untuk masukan dan $2,50 untuk keluaran per juta token. Model ini juga cepat, sekitar 350 token keluaran per detik.

Gunakan Flash-Lite ketika biaya dan latensi lebih penting daripada kualitas maksimal. Gunakan Gemini 3.6 Flash saat tugas memerlukan keluaran lebih andal, penalaran lebih baik, atau kemampuan agentik yang lebih kuat.

Gemini 3.5 Pro belum dirilis secara publik. Google menyatakan masih mengujinya dengan mitra. Google juga mengisyaratkan pengujian pra-pelatihan Gemini 4, tetapi itu belum berarti model tersebut dapat dipanggil melalui API hari ini.

Untuk konteks generasi sebelumnya, baca apa itu Gemini 3.5.

Menguji Gemini 3.6 Flash di Apidog

Angka tolok ukur tidak menggantikan pengujian pada prompt dan data Anda sendiri. Sebelum memigrasikan trafik, buat pengujian regresi untuk memvalidasi:

  • Status respons
  • Struktur JSON
  • Format jawaban
  • Bidang yang wajib tersedia
  • Latensi
  • Hasil untuk prompt penting
  • Perilaku saat konteks panjang

Apidog adalah klien API dan platform pengujian yang dapat digunakan untuk mengirim, memvalidasi, dan menjadwalkan panggilan Gemini API.

Langkah 1: Buat permintaan POST

Buat permintaan POST ke endpoint Gemini API dan gunakan model berikut:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Tambahkan header:

Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode

Langkah 2: Simpan API key sebagai variabel lingkungan

Jangan tempel API key ke URL atau koleksi permintaan. Buat variabel lingkungan, misalnya:

GEMINI_API_KEY
Enter fullscreen mode Exit fullscreen mode

Dengan cara ini, Anda dapat berpindah antara key pengembangan, staging, dan produksi tanpa mengubah definisi permintaan.

Langkah 3: Tambahkan assertion respons

Setelah mengirim permintaan, tambahkan assertion untuk memastikan respons tetap sesuai kontrak aplikasi Anda.

Contoh yang perlu diuji:

- Status code adalah 200
- Respons memiliki content
- Respons memiliki parts
- parts berisi text
- Text tidak kosong
Enter fullscreen mode Exit fullscreen mode

Jika pembaruan model mengubah bentuk respons atau menghasilkan payload yang tidak sesuai harapan, pengujian harus gagal secara eksplisit.

Langkah 4: Simpan sebagai pengujian regresi

Simpan permintaan untuk prompt penting, misalnya:

  • Ekstraksi data dari faktur
  • Ringkasan dokumen
  • Klasifikasi tiket dukungan
  • Pembuatan kode
  • Pemanggilan alat
  • Analisis konteks panjang

Kemudian jadwalkan pengujian API agar berjalan secara berkala.

Apidog tidak menjalankan model dan bukan kerangka kerja AI. Perannya adalah membantu Anda membangun permintaan, mengirimkannya, serta memverifikasi respons terhadap standar yang Anda tetapkan.

Saat Google merilis pembaruan model berikutnya, pengujian tersimpan dapat menunjukkan dengan cepat apakah ada perubahan pada respons, skema, atau latensi yang diandalkan aplikasi Anda. Unduh Apidog untuk menyiapkan permintaan pertama Anda.

FAQ

Apakah Gemini 3.6 Flash gratis?

Ada tingkat gratis melalui Google AI Studio, tetapi dibatasi laju dan ditujukan untuk pembuatan prototipe. Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya. Untuk trafik produksi, biayanya $1,50 per juta token masukan dan $7,50 per juta token keluaran.

Apakah Gemini 3.6 Flash lebih baik dari Gemini 3.5 Flash?

Untuk sebagian besar pekerjaan, ya. Model ini menggunakan sekitar 17% lebih sedikit token keluaran, harga keluaran turun dari $9,00 menjadi $7,50 per juta token, serta memiliki hasil lebih kuat pada pengkodean dan penggunaan komputer. Pada OSWorld-Verified, skornya naik dari 78,4% menjadi 83,0%.

Apakah Gemini 3.5 Pro sudah dirilis?

Belum. Google menyatakan Gemini 3.5 Pro masih diuji bersama mitra, sehingga belum ada model Pro publik dalam rilis ini.

Apa ID model Gemini 3.6 Flash?

Gunakan:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Jangan tertukar dengan:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Flash-Lite adalah tingkatan yang berbeda dan lebih murah.

Apa batasan Gemini 3.6 Flash?

Gemini 3.6 Flash hanya menghasilkan teks. Model ini dapat menerima gambar, audio, video, dan PDF sebagai masukan, tetapi tidak menghasilkan media tersebut sebagai keluaran.

Selain itu, akurasi pengambilan informasi menurun saat konteks mendekati 1 juta token. Uji prompt dan panjang konteks produksi Anda sendiri sebelum mengandalkan konteks maksimum.

Gemini 3.6 Flash adalah pilihan utama untuk sebagian besar trafik Gemini API yang membutuhkan biaya rendah, efisiensi token, dan kemampuan agentik yang lebih baik dibandingkan model sebelumnya. Sebelum migrasi skala besar, buat dan jalankan pengujian regresi pada prompt yang benar-benar penting bagi aplikasi Anda.