
LucasGemini 3.6 Flash é o novo modelo “burro de carga” do Google. Ele se tornou geralmente disponível em...
Gemini 3.6 Flash é o novo modelo “burro de carga” do Google. Ele se tornou geralmente disponível em 21 de julho de 2026 e substitui o Gemini 3.5 Flash com menor custo e maior eficiência de tokens. Para tráfego de API em alto volume que exige qualidade sólida sem custo de modelo de ponta, este é o nível projetado pelo Google.
Neste guia, você verá as especificações, preços, benchmarks e formas de acesso ao modelo. Também há um fluxo prático para testar chamadas da API e criar testes de regressão antes de migrar tráfego de produção.
Gemini 3.6 Flash é o modelo de médio porte e alto rendimento da família Gemini. Ele é voltado para tarefas recorrentes de produção, como:
A saída é somente texto, mas você pode enviar diferentes modalidades de entrada na mesma solicitação.
O Google lançou três modelos em 21 de julho de 2026:
| Modelo | Posicionamento |
|---|---|
| Gemini 3.6 Flash | Modelo principal para alto volume e qualidade equilibrada |
| Gemini 3.5 Flash-Lite | Nível mais barato e rápido para cargas simples e sensíveis à latência |
| Gemini 3.5 Flash Cyber | Modelo de segurança restrito a governos e parceiros confiáveis |
Consulte também:
O versionamento não é uniforme entre os modelos Flash. O modelo principal avançou para 3.6, enquanto Flash-Lite e Flash Cyber permaneceram em 3.5.
Use o ID correto na integração:
gemini-3.6-flash
Não confunda com:
gemini-3.5-flash-lite
Eles representam níveis diferentes, não variações de nome.
O anúncio está no blog do Google, e o cartão do modelo está na página Gemini Flash da DeepMind.
A mudança principal é eficiência.
O Gemini 3.6 Flash usa cerca de 17% menos tokens de saída para concluir o mesmo trabalho que o Gemini 3.5 Flash. Na prática, isso pode reduzir custo e latência, pois tokens de saída são mais caros e levam mais tempo para serem transmitidos.
O preço de saída também caiu:
| Modelo | Preço por 1M de tokens de saída |
|---|---|
| Gemini 3.5 Flash | US$ 9,00 |
| Gemini 3.6 Flash | US$ 7,50 |
O modelo também melhorou em:
Para agentes, menos loops e menos chamadas de ferramenta significam menor latência ponta a ponta e menor custo por execução.
Antes de migrar tráfego existente, compare o comportamento dos seus prompts com o guia Gemini 3.6 Flash vs 3.5 Flash.
| Atributo | Gemini 3.6 Flash |
|---|---|
| ID do modelo | gemini-3.6-flash |
| Janela de contexto de entrada | 1M tokens |
| Saída máxima | 64k tokens |
| Modalidades de entrada | Texto, imagem, vídeo, áudio e PDF |
| Saída | Somente texto |
| Preço de entrada | US$ 1,50 por 1M tokens |
| Preço de saída | US$ 7,50 por 1M tokens, incluindo tokens de “pensamento” |
| Nível gratuito | Sim, via Google AI Studio, com limite de taxa |
| Lançamento | 21 de julho de 2026 |
Dois limites devem orientar sua implementação:
Benchmarks não são garantia de desempenho para seu caso de uso, mas ajudam a identificar onde o modelo é mais forte.
| Benchmark | Resultado |
|---|---|
| SWE-Bench Pro | 58,7% |
| DeepSWE v1.1 | 49% |
| Terminal-bench 2.1 | 78,0% |
O SWE-Bench Pro avalia a resolução de problemas reais do GitHub em repositórios de produção. O Terminal-bench 2.1 mede a capacidade de executar tarefas por comandos em um terminal real.
No OSWorld-Verified, o Gemini 3.6 Flash alcança 83,0%, acima dos 78,4% do Gemini 3.5 Flash.
Isso é relevante para agentes que precisam interagir com desktops, aplicativos ou interfaces reais.
O modelo registra Elo GDPVal-AA v2 de 1421. O GDPVal mede desempenho em tarefas profissionais, enquanto a pontuação Elo compara modelos em confrontos diretos: um valor maior indica mais vitórias relativas.
O desempenho em contexto longo exige testes próprios:
| Cenário | Resultado |
|---|---|
| Recuperação com 128k tokens | 91,8% |
| Recuperação pontual com 1M tokens | 54,0% |
O modelo mantém bom desempenho em entradas grandes, mas não presuma recuperação perfeita ao preencher toda a janela de contexto. Se sua aplicação depende de busca precisa em documentos longos, teste no tamanho real de contexto usado em produção.
O Gemini 3.6 Flash custa:
Os tokens de saída incluem tokens de “pensamento”. Portanto, o raciocínio que não aparece na resposta final ainda entra no custo.
Para cache de contexto:
O cache é útil quando sua aplicação envia repetidamente o mesmo prompt grande, documento de referência ou contexto de sistema.
Há um nível gratuito no Google AI Studio, com limite de taxa. Como o Google pode usar dados do nível gratuito para melhorar seus produtos, use-o para prototipagem, não para tráfego sensível de produção.
Veja detalhes em:
Você pode acessar o modelo por diferentes superfícies:
gemini-3.6-flash de um cliente REST ou SDK.Para desenvolvedores, a API é normalmente o caminho principal.
Fluxo recomendado:
gemini-3.6-flash.Consulte:
Pense nos modelos Flash como uma escala entre custo, velocidade e qualidade.
| Modelo | Quando usar |
|---|---|
| Gemini 3.5 Flash-Lite | Alto volume, baixa latência e tarefas mais simples |
| Gemini 3.6 Flash | Tarefas mais difíceis, melhor confiabilidade e workloads agentic |
| Modelos de ponta | Raciocínio genuinamente complexo, quando disponíveis |
O Gemini 3.5 Flash-Lite custa:
Escolha Flash-Lite para classificação, transformação simples, extração repetitiva ou workloads em que custo e velocidade sejam mais importantes que qualidade máxima. Escolha Gemini 3.6 Flash quando a tarefa exigir melhor capacidade de codificação, uso de computador ou resultados mais confiáveis.
O Gemini 3.5 Pro ainda não foi lançado publicamente. O Google informa que ele continua sendo testado com parceiros. Uma execução de pré-treinamento do Gemini 4 também foi mencionada, mas não foi lançada.
Para contexto sobre a geração anterior, veja o que é Gemini 3.5.
As páginas de modelos mostram números de melhor caso. Para saber como o Gemini 3.6 Flash funciona com seus prompts, seu contexto e seus critérios de qualidade, envie chamadas reais e valide as respostas.
Apidog é um cliente de API e plataforma de testes que pode tratar o endpoint Gemini como qualquer outra API REST.
POST para o endpoint da API Gemini. gemini-3.6-flash
Exemplos de verificações úteis:
- O status HTTP é bem-sucedido
- A resposta contém o campo esperado
- O texto retornado não está vazio
- O formato JSON continua compatível com o consumidor da API
- A latência fica dentro do limite definido pela aplicação
Depois de validar uma resposta, salve a solicitação como teste de regressão. Isso permite repetir os mesmos prompts depois de alterações de modelo, atualização de integração ou ajustes no seu sistema.
Você pode programar a execução dos testes para detectar alterações em:
O Apidog não executa o modelo e não substitui um framework de IA. Ele ajuda a construir, enviar, validar e monitorar as chamadas de API que sua aplicação depende.
Se quiser configurar a primeira solicitação, baixe o Apidog.
Existe um nível gratuito pelo Google AI Studio, com limite de taxa e foco em prototipagem. O Google pode usar dados desse nível para melhorar seus produtos. Para produção, o custo é de US$ 1,50 por 1M tokens de entrada e US$ 7,50 por 1M tokens de saída.
Para a maioria dos workloads, sim. Ele usa cerca de 17% menos tokens de saída, reduz o preço de saída de US$ 9,00 para US$ 7,50 por 1M tokens e melhora resultados em codificação e uso de computador. No OSWorld-Verified, sobe de 78,4% para 83,0%.
Não. O Google informa que continua testando o Gemini 3.5 Pro com parceiros. Não há um modelo Pro público neste lançamento.
Use:
gemini-3.6-flash
Não confunda com gemini-3.5-flash-lite, que é o modelo Flash-Lite mais barato.
Ele gera apenas texto. Embora aceite imagens, áudio, vídeo e PDFs como entrada, não gera essas modalidades como saída.
Além disso:
Gemini 3.6 Flash é uma opção prática para grande parte do tráfego da API Gemini: reduz custo, usa menos tokens de saída e melhora workloads agentic em relação ao Gemini 3.5 Flash. Antes de migrar em escala, crie uma suíte de prompts representativos, execute testes de regressão e compare custo, latência e qualidade com a versão atual.