Como usar a Gemini 3.6 Flash API

Como usar a Gemini 3.6 Flash API

Como usar a Gemini 3.6 Flash APILucas

Você chama o Gemini 3.6 Flash pela API Gemini usando o ID de modelo gemini-3.6-flash. O Google lançou...

Você chama o Gemini 3.6 Flash pela API Gemini usando o ID de modelo gemini-3.6-flash. O Google lançou a atualização Flash em 21 de julho de 2026, e o 3.6 Flash é a camada principal: menor custo de saída que o 3.5 Flash, janela de contexto de 1M de tokens e suporte a texto, imagem, vídeo, áudio e PDF como entrada. Neste guia, você vai obter uma chave, testar a primeira chamada com curl e Python, configurar parâmetros e criar um teste de regressão para monitorar a integração.

Experimente o Apidog hoje

O que você precisa antes de começar

Prepare estes três itens:

  • Uma conta Google para criar a chave.
  • Uma chave da API Gemini, obtida no Google AI Studio.
  • Um cliente HTTP: curl, Python ou um cliente de API como o Apidog.

Você não precisa configurar faturamento para começar. A camada gratuita do AI Studio permite testar a API, embora tenha limites de taxa.

Obtenha uma chave de API Gemini

  1. Acesse o Google AI Studio.
  2. Faça login com sua conta Google.
  3. Clique em Obter chave de API.
  4. Clique em Criar chave de API.
  5. Copie a chave e armazene-a como um segredo.

Não coloque a chave no frontend nem a envie para um repositório. Defina-a como variável de ambiente:

export GEMINI_API_KEY="sua_chave_aqui"
Enter fullscreen mode Exit fullscreen mode

O SDK oficial do Python lê essa variável automaticamente. Para as etapas oficiais de configuração, consulte a documentação da API Gemini do Google.

Faça sua primeira chamada de API

A API REST usa o método generateContent. Teste com curl:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: SUA_CHAVE_API" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "contents": [
      {
        "parts": [
          {"text": "Explique como as APIs funcionam"}
        ]
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Pontos importantes da requisição:

  • Envie a chave no cabeçalho x-goog-api-key.
  • Use contents para representar o conteúdo da conversa.
  • Cada item de contents possui um array parts.
  • Para prompts simples, cada parte pode conter apenas text.

Essa estrutura também permite combinar texto, imagens e arquivos na mesma chamada.

Faça a mesma chamada em Python

Instale o SDK:

pip install google-genai
Enter fullscreen mode Exit fullscreen mode

Crie um arquivo, por exemplo gemini.py:

from google import genai

client = genai.Client()  # lê GEMINI_API_KEY do ambiente

resp = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="Explique como as APIs funcionam",
)

print(resp.text)
Enter fullscreen mode Exit fullscreen mode

O valor de resp.text contém o texto gerado. A resposta HTTP completa é JSON, e o texto normalmente está em:

candidates[0].content.parts[0].text
Enter fullscreen mode Exit fullscreen mode

Guarde esse caminho: ele será útil para validar respostas em testes automatizados.

Parâmetros importantes

A chamada mínima funciona, mas estes parâmetros ajudam a controlar comportamento, custo e formato da saída.

  • Instrução do sistema: defina regras persistentes para a conversa, como “Responda apenas em JSON” ou “Você é um revisor de código conciso”. Isso evita repetir a mesma instrução em cada prompt.
  • Máximo de tokens de saída: limite o tamanho da resposta. O 3.6 Flash pode produzir até 64 mil tokens de saída. Aumente esse limite para respostas extensas ou reduza-o para controlar custo e latência.
  • Entradas multimodais: envie texto, imagens, vídeo, áudio e PDFs no array parts. A saída é apenas texto.
  • Pensamento e raciocínio: o 3.6 Flash pode raciocinar antes de responder a tarefas mais difíceis. Ajuste o esforço de raciocínio quando precisar equilibrar profundidade e velocidade.

Consulte a documentação da API Gemini para os nomes e formatos atuais dos campos. Não adivinhe parâmetros: a documentação é a fonte de verdade.

Preços e camada gratuita

O Gemini 3.6 Flash custa:

  • US$ 1,50 por 1M de tokens de entrada
  • US$ 7,50 por 1M de tokens de saída

A taxa de saída é menor que os US$ 9,00 cobrados pelo 3.5 Flash. Além disso, o 3.6 Flash tende a gerar cerca de 17% menos tokens de saída para a mesma tarefa.

Atenção: o preço de saída inclui tokens de pensamento. Um prompt que exige raciocínio intenso pode custar mais do que o tamanho visível da resposta indica. Para calcular cenários de custo, consulte o guia de preços do Gemini 3.6 Flash.

A camada gratuita funciona pelo AI Studio, mas tem limites por minuto e por dia. O Google também pode usar dados dessa camada para melhorar seus produtos. Use-a para aprendizado, protótipos e testes iniciais; não para tráfego de produção.

Veja mais detalhes em como usar o Gemini 3.6 Flash gratuitamente. Quando precisar de mais capacidade, habilite o faturamento: a mesma chave continua funcionando e você não precisa alterar o código.

Teste e depure a API Gemini no Apidog

O curl confirma que uma chamada funciona naquele momento. Mas ele não monitora mudanças no formato da resposta, expiração de chave ou falhas introduzidas por uma implantação.

Para isso, crie um teste repetível no Apidog.

Configure a requisição

  1. Crie uma requisição POST.
  2. Use esta URL:
   https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent
Enter fullscreen mode Exit fullscreen mode
  1. Adicione o cabeçalho:
   x-goog-api-key: {{GEMINI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode
  1. Cole o corpo JSON:
   {
     "contents": [
       {
         "parts": [
           {
             "text": "Explique como as APIs funcionam"
           }
         ]
       }
     ]
   }
Enter fullscreen mode Exit fullscreen mode
  1. Crie a variável de ambiente GEMINI_API_KEY no Apidog e armazene a chave nela.

Assim, o segredo não fica salvo na requisição compartilhada e você pode usar valores diferentes para ambientes como desenvolvimento, staging e produção.

Adicione asserções de regressão

Depois de executar a requisição, valide:

  • O status HTTP é 200.
  • candidates[0].content.parts[0].text existe.
  • O texto retornado não está vazio.

Essas verificações confirmam que a API não apenas respondeu, mas retornou conteúdo no formato esperado pela aplicação.

Salve e agende o teste

Mantenha a requisição em uma coleção e agende-a como teste de regressão. Execute-o periodicamente ou no CI para detectar falhas antes que elas cheguem aos usuários.

Baixe o Apidog para criar e executar esse teste. O Apidog não executa o modelo: ele ajuda a garantir que a API Gemini continue respondendo como sua aplicação espera.

Erros comuns e soluções

401 Não Autorizado

A chave está ausente, inválida ou revogada.

Verifique:

  • Se o cabeçalho é x-goog-api-key.
  • Se a chave copiada do AI Studio está completa.
  • Se a variável de ambiente foi expandida corretamente.
  • Se não há espaços extras no valor.

Em clientes de API, confira se {{GEMINI_API_KEY}} foi resolvido antes de enviar a requisição.

429 Muitas Requisições

Você atingiu o limite de taxa da camada gratuita.

Para resolver:

  • Reduza a frequência das requisições.
  • Adicione novas tentativas com backoff.
  • Evite ciclos de teste muito curtos.
  • Habilite faturamento quando precisar de limites maiores.

404 Não Encontrado

Normalmente, isso indica um ID de modelo incorreto.

Use exatamente:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Não use gemini-3.5-flash nem gemini-flash-3.6. O modelo gemini-3.5-flash-lite pertence à linha 3.5 e é um modelo diferente.

FAQ

Qual é o ID exato do modelo Gemini 3.6 Flash?

Use gemini-3.6-flash no SDK e no caminho REST antes de :generateContent.

A API Gemini 3.6 Flash é gratuita?

Existe uma camada gratuita no AI Studio com limite de taxa. Ela é adequada para prototipagem e aprendizado. Para produção, habilite o faturamento. Consulte como usar gratuitamente.

O que posso enviar ao modelo?

Texto, imagens, vídeo, áudio e PDFs, até o limite de contexto de 1M de tokens. A saída é somente texto.

Por que o custo é maior que o texto visível na resposta?

O preço de saída inclui tokens de pensamento. Prompts que exigem raciocínio intenso podem consumir mais tokens do que a resposta exibida.

A chamada é igual à da API Gemini 3.5 Flash?

A estrutura da chamada é a mesma. Se você já usou a API Gemini 3.5, basta trocar o ID do modelo. O 3.6 Flash reduz o preço de saída e tende a usar menos tokens para a mesma tarefa.

Posso usar a mesma chave em curl, Python e Apidog?

Sim. Uma chave criada no AI Studio funciona nas três opções. Armazene-a como variável de ambiente em cada ferramenta para facilitar rotação e revogação.

Próximos passos

Você já tem o necessário para integrar o Gemini 3.6 Flash:

  1. Criar e proteger uma chave de API.
  2. Fazer uma chamada com curl.
  3. Usar o SDK Python.
  4. Configurar parâmetros relevantes.
  5. Criar um teste de regressão para o endpoint.

Comece pela camada gratuita, mantenha a chave fora do código e use a documentação oficial como referência para recursos avançados. Quando essa chamada se tornar crítica para seu produto, monitore-a com um teste no Apidog.