
Sebastian PetrusBạn có thể gọi Gemini 3.6 Flash bằng ID mô hình gemini-3.6-flash qua Gemini API của Google. Google...
Bạn có thể gọi Gemini 3.6 Flash bằng ID mô hình gemini-3.6-flash qua Gemini API của Google. Google phát hành bản cập nhật Flash vào ngày 21 tháng 7 năm 2026; Gemini 3.6 Flash là mẫu “ngựa chiến” với chi phí đầu ra thấp hơn 3.5 Flash, cửa sổ ngữ cảnh 1M token và hỗ trợ đầu vào văn bản, hình ảnh, video, âm thanh, PDF. Bài viết này hướng dẫn lấy khóa API, gọi API bằng curl và Python, cấu hình các tham số cần thiết, rồi tạo bài kiểm thử hồi quy cho endpoint.
Chuẩn bị ba thứ sau:
curl để thử nhanh trong terminal.Bạn không cần thiết lập thanh toán để bắt đầu. Gói miễn phí qua AI Studio có giới hạn tốc độ, phù hợp để học và thử nghiệm.
Không đưa khóa vào mã phía client hoặc commit vào Git. Thay vào đó, dùng biến môi trường:
export GEMINI_API_KEY="your_key_here"
SDK Python có thể đọc biến này trực tiếp. Xem thêm tài liệu Gemini API chính thức để cập nhật cách thiết lập mới nhất.
Gửi POST tới phương thức generateContent của mô hình:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"contents": [
{
"parts": [
{
"text": "Giải thích cách thức hoạt động của API"
}
]
}
]
}'
Các phần quan trọng:
x-goog-api-key: khóa API Gemini.contents: danh sách nội dung gửi cho mô hình.parts: các phần của một nội dung, có thể là văn bản hoặc dữ liệu đa phương thức.text: prompt dạng văn bản.Cấu trúc contents[].parts[] có vẻ dài cho prompt đơn giản, nhưng đây cũng là cấu trúc dùng để kết hợp văn bản với hình ảnh, video, âm thanh hoặc PDF.
Phản hồi là JSON. Với yêu cầu văn bản cơ bản, nội dung tạo ra thường nằm tại:
candidates[0].content.parts[0].text
Bạn sẽ dùng đường dẫn này để xác nhận response trong bài kiểm thử hồi quy.
Cài SDK:
pip install google-genai
Tạo tệp main.py:
from google import genai
client = genai.Client() # Đọc GEMINI_API_KEY từ biến môi trường
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="Giải thích cách thức hoạt động của API",
)
print(response.text)
Chạy chương trình:
python main.py
Không truyền khóa trực tiếp vào mã giúp bạn tránh lộ secret khi chia sẻ source code hoặc đẩy lên repository.
Request cơ bản đủ để bắt đầu, nhưng các cấu hình dưới đây quyết định độ dài, định dạng và cách mô hình xử lý dữ liệu.
Dùng hướng dẫn hệ thống để áp dụng quy tắc cho toàn bộ cuộc trò chuyện, chẳng hạn:
Cách này đáng tin cậy hơn việc lặp lại cùng một yêu cầu trong từng prompt.
Giới hạn token đầu ra để kiểm soát độ dài phản hồi, chi phí và độ trễ.
Gemini 3.6 Flash có thể tạo tối đa 64k token đầu ra. Tăng giới hạn khi tạo nội dung dài; giảm giới hạn khi chỉ cần câu trả lời ngắn hoặc dữ liệu có cấu trúc.
Bạn có thể gửi:
Các loại dữ liệu này được thêm vào mảng parts. Đầu ra là văn bản. Cửa sổ ngữ cảnh hỗ trợ tới 1M token đầu vào, phù hợp với tài liệu dài hoặc dữ liệu đa phương thức lớn.
Gemini 3.6 Flash có thể suy luận trước khi trả lời các tác vụ khó hoặc nhiều bước. Điều này cải thiện chất lượng cho các prompt phức tạp nhưng cũng ảnh hưởng đến số token đầu ra được tính phí.
Khi tối ưu tốc độ hoặc chi phí, hãy đánh giá mức suy luận phù hợp với từng loại tác vụ.
Luôn kiểm tra tài liệu Gemini API trước khi triển khai vì tên trường và tham số có thể thay đổi.
Gemini 3.6 Flash có giá:
Mức giá đầu ra này thấp hơn mức 9,00 USD của Gemini 3.5 Flash. Gemini 3.6 Flash cũng có xu hướng tạo ít hơn khoảng 17% token đầu ra cho cùng tác vụ.
Lưu ý rằng giá token đầu ra bao gồm cả token tư duy. Vì vậy, một prompt yêu cầu suy luận sâu có thể tốn nhiều hơn độ dài câu trả lời hiển thị. Xem phân tích chi tiết trong hướng dẫn giá Gemini 3.6 Flash.
Gói miễn phí qua AI Studio có giới hạn theo số request mỗi phút và mỗi ngày. Gói này phù hợp để tạo prototype, học API và kiểm tra tích hợp ban đầu; không nên xem là cấu hình lưu lượng production. Đọc thêm cách dùng Gemini 3.6 Flash miễn phí.
Khi cần vượt giới hạn, bạn có thể bật thanh toán và tiếp tục dùng cùng khóa API mà không cần thay đổi mã gọi.
curl xác nhận request hoạt động tại một thời điểm, nhưng không phát hiện được các lỗi phát sinh sau khi triển khai, ví dụ:
Bạn có thể dùng Apidog để lưu request và biến nó thành kiểm thử hồi quy.
Tạo request POST với URL:
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent
Thêm header:
Content-Type: application/json
x-goog-api-key: {{GEMINI_API_KEY}}
Dùng body:
{
"contents": [
{
"parts": [
{
"text": "Giải thích cách thức hoạt động của API"
}
]
}
]
}
Trong môi trường Apidog, tạo biến:
GEMINI_API_KEY
Sau đó tham chiếu biến trong header:
{{GEMINI_API_KEY}}
Cách này giúp bạn dùng các khóa khác nhau cho dev, staging và prod mà không phải sửa request.
Sau khi gửi request, tạo các xác nhận tối thiểu:
200.candidates[0].content.parts[0].text tồn tại.Mục tiêu không chỉ là xác nhận server có phản hồi, mà là xác nhận response vẫn có dữ liệu mà ứng dụng của bạn cần.
Lưu request vào collection, sau đó lên lịch kiểm thử API trong Apidog.
Bạn có thể chạy kiểm thử theo lịch hoặc trong CI để phát hiện lỗi trước khi người dùng gặp vấn đề.
Tải xuống Apidog để tạo request và kiểm thử này. Apidog không chạy mô hình; nó giúp xác nhận API Gemini vẫn phản hồi đúng như ứng dụng của bạn mong đợi.
Nguyên nhân thường gặp:
x-goog-api-key.{{GEMINI_API_KEY}} chưa được thay thế.Kiểm tra lại khóa trong AI Studio và xác nhận biến môi trường đã được thiết lập:
echo $GEMINI_API_KEY
Bạn đã chạm giới hạn request mỗi phút hoặc mỗi ngày của gói miễn phí.
Cách xử lý:
Kiểm tra ID mô hình. ID chính xác là:
gemini-3.6-flash
Không dùng các biến thể như:
gemini-3.5-flash
gemini-flash-3.6
gemini-3.5-flash-lite là một mô hình khác, thuộc dòng 3.5.
Dùng:
gemini-3.6-flash
Trong REST API, đặt ID này ngay trước :generateContent. Trong SDK, truyền nó vào tham số model.
Có gói miễn phí qua AI Studio, nhưng gói này bị giới hạn tốc độ. Nó phù hợp để học, thử nghiệm và tạo prototype. Với production, bạn cần bật thanh toán. Xem thêm cách sử dụng miễn phí.
Gemini 3.6 Flash nhận văn bản, hình ảnh, video, âm thanh và PDF. Cửa sổ ngữ cảnh hỗ trợ tới 1M token đầu vào. Đầu ra là văn bản.
Chi phí đầu ra bao gồm token tư duy của mô hình. Các prompt yêu cầu suy luận nhiều bước có thể dùng nhiều token hơn nội dung hiển thị.
Cấu trúc gọi API giống nhau. Nếu bạn đã dùng Gemini 3.5 API, bước chính là đổi ID mô hình thành gemini-3.6-flash.
Có. Một khóa từ AI Studio hoạt động với tất cả các công cụ này. Hãy lưu khóa trong biến môi trường hoặc môi trường của công cụ, thay vì hard-code vào source code.
Bạn đã có:
curl.Bắt đầu với gói miễn phí, giữ khóa API trong biến môi trường và dùng tài liệu Gemini API chính thức làm nguồn tham chiếu khi triển khai các trường hợp nâng cao. Khi Gemini API trở thành một phần của ứng dụng, hãy lưu request và kiểm thử nó bằng Apidog để phát hiện thay đổi API trước người dùng.