¿Cómo usar la API de Gemini 3.6 Flash?

¿Cómo usar la API de Gemini 3.6 Flash?

¿Cómo usar la API de Gemini 3.6 Flash?Roobia

Llamas a Gemini 3.6 Flash con el ID de modelo gemini-3.6-flash a través de la API Gemini de Google....

Llamas a Gemini 3.6 Flash con el ID de modelo gemini-3.6-flash a través de la API Gemini de Google. Google lanzó la actualización de Flash el 21 de julio de 2026, y 3.6 Flash es el nivel principal: salida más barata que 3.5 Flash, ventana de contexto de 1 millón de tokens y entradas de texto, imagen, video, audio y PDF. En esta guía obtendrás una clave, harás llamadas con curl y Python, revisarás los parámetros clave y configurarás una prueba de regresión para validar la integración después de desplegarla.

Prueba Apidog hoy

Gemini 3.6 Flash

Lo que necesitas antes de empezar

Necesitas estas tres cosas:

  • Una cuenta de Google para crear la clave.
  • Una clave de API de Gemini desde Google AI Studio.
  • Una forma de enviar solicitudes HTTP:
    • curl para probar desde la terminal.
    • Python para integrar la llamada en código.
    • Un cliente de API como Apidog para guardar, probar y automatizar solicitudes.

No necesitas configurar facturación para empezar. El nivel gratuito de AI Studio permite hacer pruebas, aunque aplica límites de velocidad.

Obtener una clave de API de Gemini

Ve a Google AI Studio, inicia sesión y sigue estos pasos:

  1. Haz clic en Obtener clave de API.
  2. Selecciona Crear clave de API.
  3. Copia la clave y guárdala en un gestor de secretos o variable de entorno.

Crear una clave de API de Gemini

No incluyas la clave en código cliente ni la subas a un repositorio. Configúrala como variable de entorno:

export GEMINI_API_KEY="your_key_here"
Enter fullscreen mode Exit fullscreen mode

El SDK oficial de Python puede leer esta variable automáticamente. Consulta la documentación de la API de Gemini de Google para los pasos de configuración actualizados.

Haz tu primera llamada a la API

El endpoint REST usa una solicitud POST al método generateContent del modelo.

Probar con curl

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "contents": [
      {
        "parts": [
          {"text": "Explain how APIs work"}
        ]
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Puntos importantes de la solicitud:

  • Envía la clave en el encabezado x-goog-api-key.
  • Usa el ID exacto gemini-3.6-flash.
  • El cuerpo incluye un array contents.
  • Cada elemento de contents contiene un array parts.
  • Una parte de texto usa la propiedad text.

Esta estructura también permite combinar texto, imágenes y archivos en una misma solicitud.

Probar con Python

Instala el SDK:

pip install google-genai
Enter fullscreen mode Exit fullscreen mode

Crea un archivo, por ejemplo gemini.py:

from google import genai

client = genai.Client()  # Lee GEMINI_API_KEY del entorno

resp = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="Explain how APIs work",
)

print(resp.text)
Enter fullscreen mode Exit fullscreen mode

Ejecuta el archivo:

python gemini.py
Enter fullscreen mode Exit fullscreen mode

El cliente lee GEMINI_API_KEY desde el entorno y resp.text contiene el texto generado.

Si inspeccionas la respuesta REST completa, el texto se encuentra en:

candidates[0].content.parts[0].text
Enter fullscreen mode Exit fullscreen mode

Usa esa ruta cuando configures aserciones en tus pruebas de API.

Parámetros clave que vale la pena conocer

La solicitud mínima funciona, pero estos parámetros ayudan a controlar la salida.

  • Instrucción del sistema: define reglas persistentes para la conversación, como “Responde solo en JSON” o “Eres un revisor de código conciso”. Mantenla separada de la instrucción del usuario.
  • Tokens de salida máximos: limita la longitud de la respuesta. Gemini 3.6 Flash puede generar hasta 64k tokens de salida. Reduce el límite para controlar costo y latencia.
  • Entradas multimodales: puedes enviar texto, imágenes, video, audio y PDF dentro del array parts. La salida es solo texto.
  • Pensamiento y razonamiento: el modelo razona antes de responder a tareas complejas. Puedes ajustar el esfuerzo de razonamiento para equilibrar profundidad y velocidad.

La ventana de contexto admite hasta 1 millón de tokens de entrada, suficiente para documentos largos, transcripciones o contenido multimodal extenso.

Consulta los nombres y formatos exactos de los campos en la documentación de la API de Gemini. No adivines parámetros: la API y su documentación pueden cambiar.

Precios y nivel gratuito

Gemini 3.6 Flash cuesta:

  • $1.50 por cada millón de tokens de entrada
  • $7.50 por cada millón de tokens de salida

La tarifa de salida reduce los $9.00 de Gemini 3.5 Flash. Además, 3.6 Flash tiende a generar alrededor de un 17% menos tokens de salida para la misma tarea.

Ten en cuenta que el precio de salida incluye los tokens de pensamiento. Una instrucción que requiere razonamiento intenso puede costar más que lo que sugiere la longitud visible de la respuesta.

Consulta los cálculos y escenarios en la guía de precios de Gemini 3.6 Flash.

El nivel gratuito funciona a través de AI Studio, pero tiene límites de solicitudes por minuto y por día. Google también puede usar datos del nivel gratuito para mejorar sus productos. Es útil para prototipos y aprendizaje, no para tráfico de producción.

Para empezar sin facturación, revisa cómo usar Gemini 3.6 Flash de forma gratuita. Cuando superes esos límites, habilita la facturación: la misma clave puede seguir funcionando sin cambios de código.

Probar y depurar la API de Gemini en Apidog

curl confirma que una llamada funciona una vez. No detecta cambios en la respuesta, claves expiradas o errores introducidos por un despliegue.

Para convertir esta integración en una prueba repetible, usa Apidog.

1. Crea la solicitud

Añade una solicitud POST con esta URL:

https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Añade el encabezado:

Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode

Y usa este cuerpo:

{
  "contents": [
    {
      "parts": [
        {
          "text": "Explain how APIs work"
        }
      ]
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

2. Guarda la clave como variable de entorno

Crea una variable de entorno llamada GEMINI_API_KEY en Apidog.

Después, configura el encabezado:

x-goog-api-key: {{GEMINI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Así puedes usar claves diferentes para desarrollo, staging y producción sin modificar la solicitud compartida.

3. Añade aserciones

Después de ejecutar la solicitud, valida como mínimo:

  • El código de estado es 200.
  • candidates[0].content.parts[0].text existe.
  • El texto generado no está vacío.

Estas comprobaciones validan que la API produjo una respuesta útil, no solo que el endpoint respondió.

4. Guarda y programa la prueba

Guarda la solicitud en una colección y prográmala como prueba de regresión.

Puedes ejecutarla periódicamente o integrarla en CI para detectar fallos antes de que afecten a los usuarios.

Descarga Apidog para crear y ejecutar esta prueba. Apidog no ejecuta el modelo: valida que la API de la que depende tu aplicación siga respondiendo como esperas.

Errores comunes y soluciones

401 No autorizado: clave inválida

La clave es incorrecta, fue revocada o no se envió correctamente.

Comprueba lo siguiente:

  • El encabezado se llama exactamente x-goog-api-key.
  • La variable GEMINI_API_KEY contiene la clave correcta.
  • No hay espacios al inicio o final de la clave.
  • {{GEMINI_API_KEY}} se resolvió correctamente en tu cliente de API.

429 Demasiadas solicitudes: límite de velocidad

Has alcanzado un límite por minuto o por día, especialmente en el nivel gratuito.

Para resolverlo:

  • Reduce la frecuencia de solicitudes.
  • Implementa reintentos con retroceso exponencial.
  • Evita bucles de prueba muy agresivos.
  • Habilita facturación si necesitas límites mayores.

404 No encontrado: modelo no encontrado

Normalmente indica un error en el ID del modelo.

Usa exactamente:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

No uses:

gemini-3.5-flash
gemini-flash-3.6
Enter fullscreen mode Exit fullscreen mode

El modelo Lite de esta línea es gemini-3.5-flash-lite, que es un modelo distinto.

Preguntas frecuentes

¿Cuál es el ID exacto del modelo para Gemini 3.6 Flash?

Es gemini-3.6-flash. Úsalo tanto en el SDK como en la URL REST antes de :generateContent.

¿Es gratuita la API de Gemini 3.6 Flash?

Hay un nivel gratuito mediante AI Studio con límites de velocidad. Es adecuado para prototipos y aprendizaje; el tráfico de producción requiere facturación habilitada. Consulta cómo usarlo gratis para más detalles.

¿Qué puedo enviar al modelo?

Texto, imágenes, video, audio y PDF, dentro de una ventana de contexto de hasta 1 millón de tokens. La salida es solo texto.

¿Por qué mi factura fue más alta que la longitud visible de las respuestas?

La tarifa de salida de $7.50 por millón de tokens incluye tokens de pensamiento. Las tareas que requieren más razonamiento pueden facturar más tokens que los visibles en la respuesta.

¿Es la misma API que Gemini 3.5 Flash?

La forma de la llamada es la misma. Si ya usaste la API de Gemini 3.5, cambia el ID del modelo por gemini-3.6-flash. Gemini 3.6 Flash reduce el precio de salida y usa menos tokens de salida para el mismo trabajo.

¿Puedo usar la misma clave en curl, Python y Apidog?

Sí. Una clave de AI Studio funciona en los tres. Guárdala como variable de entorno en cada herramienta para poder rotarla o revocarla sin modificar tu código ni solicitudes.

Adónde ir desde aquí

Ya tienes una clave, una llamada funcional en curl y Python, parámetros importantes y una prueba de regresión para monitorear el endpoint.

Empieza con el nivel gratuito, mantén la clave fuera del código y usa la documentación oficial para detalles de implementación. Cuando la llamada forme parte de tu aplicación, conviértela en una prueba de Apidog para detectar cambios silenciosos de la API antes que tus usuarios.