O que é Gemini 3.6 Flash?

O que é Gemini 3.6 Flash?

O que é Gemini 3.6 Flash?Lucas

Gemini 3.6 Flash é o novo modelo “burro de carga” do Google. Ele se tornou geralmente disponível em...

Gemini 3.6 Flash é o novo modelo “burro de carga” do Google. Ele se tornou geralmente disponível em 21 de julho de 2026 e substitui o Gemini 3.5 Flash com menor custo e maior eficiência de tokens. Para tráfego de API em alto volume que exige qualidade sólida sem custo de modelo de ponta, este é o nível projetado pelo Google.

Experimente o Apidog hoje

Neste guia, você verá as especificações, preços, benchmarks e formas de acesso ao modelo. Também há um fluxo prático para testar chamadas da API e criar testes de regressão antes de migrar tráfego de produção.

O que é o Gemini 3.6 Flash?

Gemini 3.6 Flash é o modelo de médio porte e alto rendimento da família Gemini. Ele é voltado para tarefas recorrentes de produção, como:

  • Sumarização;
  • Extração estruturada;
  • Classificação;
  • Chat;
  • Chamadas de ferramentas em várias etapas;
  • Processamento multimodal de texto, imagens, vídeo, áudio e PDFs.

A saída é somente texto, mas você pode enviar diferentes modalidades de entrada na mesma solicitação.

Visão geral do Gemini 3.6 Flash

O Google lançou três modelos em 21 de julho de 2026:

Modelo Posicionamento
Gemini 3.6 Flash Modelo principal para alto volume e qualidade equilibrada
Gemini 3.5 Flash-Lite Nível mais barato e rápido para cargas simples e sensíveis à latência
Gemini 3.5 Flash Cyber Modelo de segurança restrito a governos e parceiros confiáveis

Consulte também:

Posicionamento dos modelos Flash

Atenção ao ID do modelo

O versionamento não é uniforme entre os modelos Flash. O modelo principal avançou para 3.6, enquanto Flash-Lite e Flash Cyber permaneceram em 3.5.

Use o ID correto na integração:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Não confunda com:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Eles representam níveis diferentes, não variações de nome.

O anúncio está no blog do Google, e o cartão do modelo está na página Gemini Flash da DeepMind.

O que mudou em relação ao Gemini 3.5 Flash

A mudança principal é eficiência.

O Gemini 3.6 Flash usa cerca de 17% menos tokens de saída para concluir o mesmo trabalho que o Gemini 3.5 Flash. Na prática, isso pode reduzir custo e latência, pois tokens de saída são mais caros e levam mais tempo para serem transmitidos.

O preço de saída também caiu:

Modelo Preço por 1M de tokens de saída
Gemini 3.5 Flash US$ 9,00
Gemini 3.6 Flash US$ 7,50

O modelo também melhorou em:

  • Codificação;
  • Uso de computador;
  • Fluxos agentic com várias etapas;
  • Redução de chamadas de ferramentas;
  • Redução de etapas de raciocínio.

Para agentes, menos loops e menos chamadas de ferramenta significam menor latência ponta a ponta e menor custo por execução.

Antes de migrar tráfego existente, compare o comportamento dos seus prompts com o guia Gemini 3.6 Flash vs 3.5 Flash.

Especificações do Gemini 3.6 Flash

Atributo Gemini 3.6 Flash
ID do modelo gemini-3.6-flash
Janela de contexto de entrada 1M tokens
Saída máxima 64k tokens
Modalidades de entrada Texto, imagem, vídeo, áudio e PDF
Saída Somente texto
Preço de entrada US$ 1,50 por 1M tokens
Preço de saída US$ 7,50 por 1M tokens, incluindo tokens de “pensamento”
Nível gratuito Sim, via Google AI Studio, com limite de taxa
Lançamento 21 de julho de 2026

Dois limites devem orientar sua implementação:

  1. 1M tokens de contexto permite enviar documentos extensos, transcrições longas ou bases de código grandes em uma solicitação.
  2. 64k tokens de saída é o limite de uma resposta. Para saídas muito extensas, divida o trabalho em múltiplas chamadas e consolide o resultado no seu fluxo.

Como ele se comporta nos benchmarks

Benchmarks não são garantia de desempenho para seu caso de uso, mas ajudam a identificar onde o modelo é mais forte.

Codificação

Benchmark Resultado
SWE-Bench Pro 58,7%
DeepSWE v1.1 49%
Terminal-bench 2.1 78,0%

O SWE-Bench Pro avalia a resolução de problemas reais do GitHub em repositórios de produção. O Terminal-bench 2.1 mede a capacidade de executar tarefas por comandos em um terminal real.

Uso de computador

No OSWorld-Verified, o Gemini 3.6 Flash alcança 83,0%, acima dos 78,4% do Gemini 3.5 Flash.

Isso é relevante para agentes que precisam interagir com desktops, aplicativos ou interfaces reais.

Qualidade geral

O modelo registra Elo GDPVal-AA v2 de 1421. O GDPVal mede desempenho em tarefas profissionais, enquanto a pontuação Elo compara modelos em confrontos diretos: um valor maior indica mais vitórias relativas.

Contexto longo

O desempenho em contexto longo exige testes próprios:

Cenário Resultado
Recuperação com 128k tokens 91,8%
Recuperação pontual com 1M tokens 54,0%

O modelo mantém bom desempenho em entradas grandes, mas não presuma recuperação perfeita ao preencher toda a janela de contexto. Se sua aplicação depende de busca precisa em documentos longos, teste no tamanho real de contexto usado em produção.

Preços em resumo

O Gemini 3.6 Flash custa:

  • US$ 1,50 por 1M tokens de entrada;
  • US$ 7,50 por 1M tokens de saída.

Os tokens de saída incluem tokens de “pensamento”. Portanto, o raciocínio que não aparece na resposta final ainda entra no custo.

Para cache de contexto:

  • US$ 0,15 por 1M tokens;
  • US$ 1,00 por 1M tokens por hora de armazenamento.

O cache é útil quando sua aplicação envia repetidamente o mesmo prompt grande, documento de referência ou contexto de sistema.

Há um nível gratuito no Google AI Studio, com limite de taxa. Como o Google pode usar dados do nível gratuito para melhorar seus produtos, use-o para prototipagem, não para tráfego sensível de produção.

Veja detalhes em:

Como acessar o Gemini 3.6 Flash

Você pode acessar o modelo por diferentes superfícies:

  • API Gemini, via Google AI Studio: gere uma chave e chame gemini-3.6-flash de um cliente REST ou SDK.
  • Google Antigravity: superfície de desenvolvimento agentic do Google.
  • Gemini Enterprise Agent Platform: para equipes que criam agentes governados.
  • Aplicativo Gemini: para conversar diretamente com o modelo.

Para desenvolvedores, a API é normalmente o caminho principal.

Fluxo recomendado:

  1. Gere uma chave no Google AI Studio.
  2. Armazene a chave em uma variável de ambiente.
  3. Crie uma solicitação para o modelo gemini-3.6-flash.
  4. Teste prompts curtos, multimodais e de contexto longo.
  5. Registre custo, latência, formato de saída e taxa de sucesso.
  6. Execute os mesmos testes antes e depois da migração.

Consulte:

Onde o Gemini 3.6 Flash se encaixa na linha do Google

Pense nos modelos Flash como uma escala entre custo, velocidade e qualidade.

Modelo Quando usar
Gemini 3.5 Flash-Lite Alto volume, baixa latência e tarefas mais simples
Gemini 3.6 Flash Tarefas mais difíceis, melhor confiabilidade e workloads agentic
Modelos de ponta Raciocínio genuinamente complexo, quando disponíveis

O Gemini 3.5 Flash-Lite custa:

  • US$ 0,30 por 1M tokens de entrada;
  • US$ 2,50 por 1M tokens de saída;
  • Aproximadamente 350 tokens de saída por segundo.

Escolha Flash-Lite para classificação, transformação simples, extração repetitiva ou workloads em que custo e velocidade sejam mais importantes que qualidade máxima. Escolha Gemini 3.6 Flash quando a tarefa exigir melhor capacidade de codificação, uso de computador ou resultados mais confiáveis.

O Gemini 3.5 Pro ainda não foi lançado publicamente. O Google informa que ele continua sendo testado com parceiros. Uma execução de pré-treinamento do Gemini 4 também foi mencionada, mas não foi lançada.

Para contexto sobre a geração anterior, veja o que é Gemini 3.5.

Testando o Gemini 3.6 Flash no Apidog

As páginas de modelos mostram números de melhor caso. Para saber como o Gemini 3.6 Flash funciona com seus prompts, seu contexto e seus critérios de qualidade, envie chamadas reais e valide as respostas.

Apidog é um cliente de API e plataforma de testes que pode tratar o endpoint Gemini como qualquer outra API REST.

Configure uma solicitação de teste

  1. Crie uma solicitação POST para o endpoint da API Gemini.
  2. Defina o modelo como:
   gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode
  1. Salve a chave de API em uma variável de ambiente, em vez de incluí-la diretamente na URL ou no corpo da solicitação.
  2. Envie a chamada e revise:
    • Código de status;
    • Estrutura do JSON;
    • Conteúdo retornado;
    • Latência;
    • Uso de tokens, quando disponível.
  3. Adicione asserções para garantir que mudanças inesperadas falhem de forma visível.

Exemplos de verificações úteis:

- O status HTTP é bem-sucedido
- A resposta contém o campo esperado
- O texto retornado não está vazio
- O formato JSON continua compatível com o consumidor da API
- A latência fica dentro do limite definido pela aplicação
Enter fullscreen mode Exit fullscreen mode

Transforme a chamada em um teste de regressão

Depois de validar uma resposta, salve a solicitação como teste de regressão. Isso permite repetir os mesmos prompts depois de alterações de modelo, atualização de integração ou ajustes no seu sistema.

Você pode programar a execução dos testes para detectar alterações em:

  • Formato de resposta;
  • Campos JSON;
  • Latência;
  • Qualidade da saída;
  • Comportamento de ferramentas;
  • Compatibilidade com prompts críticos.

O Apidog não executa o modelo e não substitui um framework de IA. Ele ajuda a construir, enviar, validar e monitorar as chamadas de API que sua aplicação depende.

Se quiser configurar a primeira solicitação, baixe o Apidog.

FAQ

O Gemini 3.6 Flash é gratuito?

Existe um nível gratuito pelo Google AI Studio, com limite de taxa e foco em prototipagem. O Google pode usar dados desse nível para melhorar seus produtos. Para produção, o custo é de US$ 1,50 por 1M tokens de entrada e US$ 7,50 por 1M tokens de saída.

O Gemini 3.6 Flash é melhor que o 3.5 Flash?

Para a maioria dos workloads, sim. Ele usa cerca de 17% menos tokens de saída, reduz o preço de saída de US$ 9,00 para US$ 7,50 por 1M tokens e melhora resultados em codificação e uso de computador. No OSWorld-Verified, sobe de 78,4% para 83,0%.

O Gemini 3.5 Pro foi lançado?

Não. O Google informa que continua testando o Gemini 3.5 Pro com parceiros. Não há um modelo Pro público neste lançamento.

Qual é o ID do modelo?

Use:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Não confunda com gemini-3.5-flash-lite, que é o modelo Flash-Lite mais barato.

O que o Gemini 3.6 Flash não pode fazer?

Ele gera apenas texto. Embora aceite imagens, áudio, vídeo e PDFs como entrada, não gera essas modalidades como saída.

Além disso:

  • A recuperação pontual cai para cerca de 54,0% no limite de 1M tokens;
  • Ele é um modelo de médio porte, não um carro-chefe de ponta;
  • Casos de raciocínio muito difíceis exigem validação e escolha cuidadosa do modelo.

Gemini 3.6 Flash é uma opção prática para grande parte do tráfego da API Gemini: reduz custo, usa menos tokens de saída e melhora workloads agentic em relação ao Gemini 3.5 Flash. Antes de migrar em escala, crie uma suíte de prompts representativos, execute testes de regressão e compare custo, latência e qualidade com a versão atual.