Cách sử dụng API Gemini 3.6 Flash

Cách sử dụng API Gemini 3.6 Flash

Cách sử dụng API Gemini 3.6 FlashSebastian Petrus

Bạn có thể gọi Gemini 3.6 Flash bằng ID mô hình gemini-3.6-flash qua Gemini API của Google. Google...

Bạn có thể gọi Gemini 3.6 Flash bằng ID mô hình gemini-3.6-flash qua Gemini API của Google. Google phát hành bản cập nhật Flash vào ngày 21 tháng 7 năm 2026; Gemini 3.6 Flash là mẫu “ngựa chiến” với chi phí đầu ra thấp hơn 3.5 Flash, cửa sổ ngữ cảnh 1M token và hỗ trợ đầu vào văn bản, hình ảnh, video, âm thanh, PDF. Bài viết này hướng dẫn lấy khóa API, gọi API bằng curl và Python, cấu hình các tham số cần thiết, rồi tạo bài kiểm thử hồi quy cho endpoint.

Dùng thử Apidog ngay hôm nay

Gemini 3.6 Flash

Những gì bạn cần trước khi bắt đầu

Chuẩn bị ba thứ sau:

  • Tài khoản Google để đăng nhập và tạo khóa.
  • Khóa API Gemini từ Google AI Studio.
  • Một công cụ gửi HTTP request:
    • curl để thử nhanh trong terminal.
    • Python nếu bạn muốn tích hợp vào ứng dụng.
    • Một API client như Apidog nếu bạn cần lưu request, quản lý biến môi trường và chạy kiểm thử.

Bạn không cần thiết lập thanh toán để bắt đầu. Gói miễn phí qua AI Studio có giới hạn tốc độ, phù hợp để học và thử nghiệm.

Lấy khóa API Gemini

  1. Mở Google AI Studio và đăng nhập.
  2. Chọn Get API key.
  3. Chọn Create API key.
  4. Sao chép khóa và lưu trong nơi an toàn.

Tạo khóa Gemini API

Không đưa khóa vào mã phía client hoặc commit vào Git. Thay vào đó, dùng biến môi trường:

export GEMINI_API_KEY="your_key_here"
Enter fullscreen mode Exit fullscreen mode

SDK Python có thể đọc biến này trực tiếp. Xem thêm tài liệu Gemini API chính thức để cập nhật cách thiết lập mới nhất.

Thực hiện cuộc gọi API đầu tiên bằng curl

Gửi POST tới phương thức generateContent của mô hình:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "contents": [
      {
        "parts": [
          {
            "text": "Giải thích cách thức hoạt động của API"
          }
        ]
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Các phần quan trọng:

  • x-goog-api-key: khóa API Gemini.
  • contents: danh sách nội dung gửi cho mô hình.
  • parts: các phần của một nội dung, có thể là văn bản hoặc dữ liệu đa phương thức.
  • text: prompt dạng văn bản.

Cấu trúc contents[].parts[] có vẻ dài cho prompt đơn giản, nhưng đây cũng là cấu trúc dùng để kết hợp văn bản với hình ảnh, video, âm thanh hoặc PDF.

Phản hồi là JSON. Với yêu cầu văn bản cơ bản, nội dung tạo ra thường nằm tại:

candidates[0].content.parts[0].text
Enter fullscreen mode Exit fullscreen mode

Bạn sẽ dùng đường dẫn này để xác nhận response trong bài kiểm thử hồi quy.

Gọi Gemini 3.6 Flash bằng Python

Cài SDK:

pip install google-genai
Enter fullscreen mode Exit fullscreen mode

Tạo tệp main.py:

from google import genai

client = genai.Client()  # Đọc GEMINI_API_KEY từ biến môi trường

response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="Giải thích cách thức hoạt động của API",
)

print(response.text)
Enter fullscreen mode Exit fullscreen mode

Chạy chương trình:

python main.py
Enter fullscreen mode Exit fullscreen mode

Không truyền khóa trực tiếp vào mã giúp bạn tránh lộ secret khi chia sẻ source code hoặc đẩy lên repository.

Các tham số nên cấu hình

Request cơ bản đủ để bắt đầu, nhưng các cấu hình dưới đây quyết định độ dài, định dạng và cách mô hình xử lý dữ liệu.

Hướng dẫn hệ thống

Dùng hướng dẫn hệ thống để áp dụng quy tắc cho toàn bộ cuộc trò chuyện, chẳng hạn:

  • Chỉ trả lời bằng JSON.
  • Trả lời bằng tiếng Việt.
  • Đóng vai trò reviewer code ngắn gọn.
  • Không giải thích, chỉ trả về kết quả.

Cách này đáng tin cậy hơn việc lặp lại cùng một yêu cầu trong từng prompt.

Token đầu ra tối đa

Giới hạn token đầu ra để kiểm soát độ dài phản hồi, chi phí và độ trễ.

Gemini 3.6 Flash có thể tạo tối đa 64k token đầu ra. Tăng giới hạn khi tạo nội dung dài; giảm giới hạn khi chỉ cần câu trả lời ngắn hoặc dữ liệu có cấu trúc.

Đầu vào đa phương thức

Bạn có thể gửi:

  • Văn bản
  • Hình ảnh
  • Video
  • Âm thanh
  • PDF

Các loại dữ liệu này được thêm vào mảng parts. Đầu ra là văn bản. Cửa sổ ngữ cảnh hỗ trợ tới 1M token đầu vào, phù hợp với tài liệu dài hoặc dữ liệu đa phương thức lớn.

Tư duy và suy luận

Gemini 3.6 Flash có thể suy luận trước khi trả lời các tác vụ khó hoặc nhiều bước. Điều này cải thiện chất lượng cho các prompt phức tạp nhưng cũng ảnh hưởng đến số token đầu ra được tính phí.

Khi tối ưu tốc độ hoặc chi phí, hãy đánh giá mức suy luận phù hợp với từng loại tác vụ.

Luôn kiểm tra tài liệu Gemini API trước khi triển khai vì tên trường và tham số có thể thay đổi.

Giá cả và gói miễn phí

Gemini 3.6 Flash có giá:

  • 1,50 USD / 1 triệu token đầu vào
  • 7,50 USD / 1 triệu token đầu ra

Mức giá đầu ra này thấp hơn mức 9,00 USD của Gemini 3.5 Flash. Gemini 3.6 Flash cũng có xu hướng tạo ít hơn khoảng 17% token đầu ra cho cùng tác vụ.

Lưu ý rằng giá token đầu ra bao gồm cả token tư duy. Vì vậy, một prompt yêu cầu suy luận sâu có thể tốn nhiều hơn độ dài câu trả lời hiển thị. Xem phân tích chi tiết trong hướng dẫn giá Gemini 3.6 Flash.

Gói miễn phí qua AI Studio có giới hạn theo số request mỗi phút và mỗi ngày. Gói này phù hợp để tạo prototype, học API và kiểm tra tích hợp ban đầu; không nên xem là cấu hình lưu lượng production. Đọc thêm cách dùng Gemini 3.6 Flash miễn phí.

Khi cần vượt giới hạn, bạn có thể bật thanh toán và tiếp tục dùng cùng khóa API mà không cần thay đổi mã gọi.

Kiểm thử và gỡ lỗi Gemini API trong Apidog

curl xác nhận request hoạt động tại một thời điểm, nhưng không phát hiện được các lỗi phát sinh sau khi triển khai, ví dụ:

  • Khóa API bị thu hồi hoặc hết hiệu lực.
  • Request bị thay đổi ngoài ý muốn.
  • Response không còn đúng cấu trúc ứng dụng mong đợi.
  • Endpoint trả lỗi sau một bản cập nhật.

Bạn có thể dùng Apidog để lưu request và biến nó thành kiểm thử hồi quy.

1. Tạo request

Tạo request POST với URL:

https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Thêm header:

Content-Type: application/json
x-goog-api-key: {{GEMINI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Dùng body:

{
  "contents": [
    {
      "parts": [
        {
          "text": "Giải thích cách thức hoạt động của API"
        }
      ]
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

2. Lưu khóa dưới dạng biến môi trường

Trong môi trường Apidog, tạo biến:

GEMINI_API_KEY
Enter fullscreen mode Exit fullscreen mode

Sau đó tham chiếu biến trong header:

{{GEMINI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Cách này giúp bạn dùng các khóa khác nhau cho dev, stagingprod mà không phải sửa request.

3. Thêm assertions cho response

Sau khi gửi request, tạo các xác nhận tối thiểu:

  • HTTP status là 200.
  • candidates[0].content.parts[0].text tồn tại.
  • Nội dung trả về không rỗng.

Mục tiêu không chỉ là xác nhận server có phản hồi, mà là xác nhận response vẫn có dữ liệu mà ứng dụng của bạn cần.

4. Lưu và lên lịch chạy kiểm thử

Lưu request vào collection, sau đó lên lịch kiểm thử API trong Apidog.

Bạn có thể chạy kiểm thử theo lịch hoặc trong CI để phát hiện lỗi trước khi người dùng gặp vấn đề.

Tải xuống Apidog để tạo request và kiểm thử này. Apidog không chạy mô hình; nó giúp xác nhận API Gemini vẫn phản hồi đúng như ứng dụng của bạn mong đợi.

Các lỗi thường gặp và cách khắc phục

401 Unauthorized: khóa không hợp lệ

Nguyên nhân thường gặp:

  • Khóa API sai hoặc đã bị thu hồi.
  • Thiếu header x-goog-api-key.
  • Biến môi trường không được nạp.
  • Giá trị {{GEMINI_API_KEY}} chưa được thay thế.
  • Có khoảng trắng thừa trong khóa.

Kiểm tra lại khóa trong AI Studio và xác nhận biến môi trường đã được thiết lập:

echo $GEMINI_API_KEY
Enter fullscreen mode Exit fullscreen mode

429 Too Many Requests: vượt giới hạn tốc độ

Bạn đã chạm giới hạn request mỗi phút hoặc mỗi ngày của gói miễn phí.

Cách xử lý:

  • Giảm tốc độ gửi request.
  • Thêm cơ chế retry với thời gian chờ.
  • Tránh chạy vòng lặp kiểm thử liên tục.
  • Bật thanh toán nếu cần giới hạn cao hơn.

404 Not Found: không tìm thấy mô hình

Kiểm tra ID mô hình. ID chính xác là:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Không dùng các biến thể như:

gemini-3.5-flash
gemini-flash-3.6
Enter fullscreen mode Exit fullscreen mode

gemini-3.5-flash-lite là một mô hình khác, thuộc dòng 3.5.

Câu hỏi thường gặp

ID mô hình chính xác của Gemini 3.6 Flash là gì?

Dùng:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Trong REST API, đặt ID này ngay trước :generateContent. Trong SDK, truyền nó vào tham số model.

Gemini 3.6 Flash có miễn phí không?

Có gói miễn phí qua AI Studio, nhưng gói này bị giới hạn tốc độ. Nó phù hợp để học, thử nghiệm và tạo prototype. Với production, bạn cần bật thanh toán. Xem thêm cách sử dụng miễn phí.

Tôi có thể gửi những loại dữ liệu nào?

Gemini 3.6 Flash nhận văn bản, hình ảnh, video, âm thanh và PDF. Cửa sổ ngữ cảnh hỗ trợ tới 1M token đầu vào. Đầu ra là văn bản.

Vì sao chi phí cao hơn độ dài phản hồi nhìn thấy?

Chi phí đầu ra bao gồm token tư duy của mô hình. Các prompt yêu cầu suy luận nhiều bước có thể dùng nhiều token hơn nội dung hiển thị.

Tôi đang dùng Gemini 3.5 Flash. Có cần thay đổi nhiều không?

Cấu trúc gọi API giống nhau. Nếu bạn đã dùng Gemini 3.5 API, bước chính là đổi ID mô hình thành gemini-3.6-flash.

Có thể dùng cùng một khóa cho curl, Python và Apidog không?

Có. Một khóa từ AI Studio hoạt động với tất cả các công cụ này. Hãy lưu khóa trong biến môi trường hoặc môi trường của công cụ, thay vì hard-code vào source code.

Bước tiếp theo

Bạn đã có:

  1. Khóa Gemini API.
  2. Request hoạt động bằng curl.
  3. Ví dụ tích hợp Python.
  4. Các tham số cần quan tâm.
  5. Quy trình tạo kiểm thử hồi quy cho endpoint.

Bắt đầu với gói miễn phí, giữ khóa API trong biến môi trường và dùng tài liệu Gemini API chính thức làm nguồn tham chiếu khi triển khai các trường hợp nâng cao. Khi Gemini API trở thành một phần của ứng dụng, hãy lưu request và kiểm thử nó bằng Apidog để phát hiện thay đổi API trước người dùng.