Gemini 3.6 Flash là gì?

Gemini 3.6 Flash là gì?

Gemini 3.6 Flash là gì?Sebastian Petrus

Gemini 3.6 Flash là mô hình chủ lực mới của Google, được phát hành rộng rãi vào ngày 21 tháng 7 năm...

Gemini 3.6 Flash là mô hình chủ lực mới của Google, được phát hành rộng rãi vào ngày 21 tháng 7 năm 2026. Mô hình này rẻ hơn và hiệu quả token hơn Gemini 3.5 Flash mà nó thay thế, phù hợp khi bạn cần xử lý lưu lượng API lớn với chất lượng ổn định mà không phải trả mức giá của một mô hình cao cấp.

Dùng thử Apidog ngay hôm nay

Bài viết này tập trung vào những điểm cần triển khai: khác biệt so với Gemini 3.5 Flash, thông số kỹ thuật, giá, cách gọi API và cách thiết lập kiểm thử hồi quy để xác minh phản hồi thực tế của mô hình.

Gemini 3.6 Flash là gì?

Gemini 3.6 Flash là mô hình thông lượng cao, cấp trung trong họ Gemini của Google. Đây là lựa chọn cho phần lớn lưu lượng production hằng ngày, chẳng hạn như:

  • Tóm tắt tài liệu
  • Trích xuất dữ liệu có cấu trúc
  • Phân loại nội dung
  • Chatbot
  • Workflow gọi công cụ nhiều bước
  • Tác nhân (agent) cần thao tác với công cụ hoặc máy tính

Mô hình nhận đầu vào là văn bản, hình ảnh, video, âm thanh và PDF trong cùng một yêu cầu. Đầu ra chỉ là văn bản.

Gemini 3.6 Flash

Google phát hành Gemini 3.6 Flash cùng hai mô hình khác vào ngày 21 tháng 7 năm 2026:

  • Gemini 3.5 Flash-Lite: bản nhanh và rẻ hơn cho tác vụ khối lượng lớn.
  • Gemini 3.5 Flash Cyber: mô hình bảo mật được kiểm soát, chỉ dành cho chính phủ và đối tác đáng tin cậy.

Xem thêm:

Các dòng mô hình Gemini Flash

Điểm dễ gây nhầm lẫn là số phiên bản không đồng nhất:

gemini-3.6-flash
gemini-3.5-flash-lite
gemini-3.5-flash-cyber
Enter fullscreen mode Exit fullscreen mode

gemini-3.6-flashgemini-3.5-flash-lite là hai cấp mô hình khác nhau, không phải lỗi đánh máy. Khi thay đổi model ID trong production, hãy kiểm tra chính xác tên model trong cấu hình và bộ kiểm thử của bạn.

Google công bố thông tin trên blog của Google. Thẻ mô hình có trên trang DeepMind Flash.

Có gì mới so với Gemini 3.5 Flash?

Thay đổi quan trọng nhất là hiệu quả token. Gemini 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra so với Gemini 3.5 Flash khi hoàn thành cùng một tác vụ.

Điều này tác động trực tiếp đến hai yếu tố:

  1. Chi phí thấp hơn: token đầu ra thường là phần chi phí lớn hơn.
  2. Phản hồi nhanh hơn: ít token cần sinh và truyền tải hơn.

Google cũng giảm giá token đầu ra:

Mô hình Giá đầu ra / 1M token
Gemini 3.5 Flash 9,00 USD
Gemini 3.6 Flash 7,50 USD

Gemini 3.6 Flash cũng cải thiện khả năng viết mã, sử dụng máy tính và thực hiện workflow nhiều bước với ít vòng suy luận hoặc lệnh gọi công cụ hơn.

Nếu bạn vận hành agent, hãy đo ít nhất các chỉ số sau trước và sau khi chuyển model:

  • Tổng số token đầu vào/đầu ra mỗi tác vụ
  • Số lần gọi công cụ
  • Độ trễ end-to-end
  • Tỷ lệ hoàn thành tác vụ
  • Tỷ lệ lỗi do schema hoặc tool call

Xem phân tích chuyển đổi lưu lượng tại Gemini 3.6 Flash so với 3.5 Flash.

Thông số kỹ thuật của Gemini 3.6 Flash

Thuộc tính Gemini 3.6 Flash
ID mô hình gemini-3.6-flash
Cửa sổ ngữ cảnh đầu vào 1M token
Đầu ra tối đa 64k token
Hình thức đầu vào Văn bản, hình ảnh, video, âm thanh, PDF
Đầu ra Chỉ văn bản
Giá đầu vào 1,50 USD / 1M token
Giá đầu ra 7,50 USD / 1M token, bao gồm token suy nghĩ
Cấp miễn phí Có, qua Google AI Studio, có giới hạn tốc độ
Ra mắt 21 tháng 7 năm 2026

Cửa sổ ngữ cảnh 1M token cho phép bạn gửi tài liệu lớn, bản ghi dài hoặc lượng lớn mã nguồn trong một lần gọi. Tuy nhiên, đầu ra bị giới hạn ở 64k token, vì vậy cần chia tác vụ thành nhiều lượt nếu bạn phải tạo nội dung rất dài.

Ví dụ, thay vì yêu cầu mô hình tạo toàn bộ tài liệu dài trong một phản hồi, hãy chia workflow thành:

  1. Lập dàn ý.
  2. Sinh từng chương hoặc từng phần.
  3. Kiểm tra tính nhất quán giữa các phần.
  4. Ghép và xác thực đầu ra cuối cùng.

Hiệu suất của Gemini 3.6 Flash

Các benchmark không phải là cam kết cho workload của bạn, nhưng chúng giúp xác định loại tác vụ nên thử nghiệm trước.

Theo số liệu Google báo cáo:

Benchmark Gemini 3.6 Flash
SWE-Bench Pro 58,7%
DeepSWE v1.1 49%
Terminal-bench 2.1 78,0%
OSWorld-Verified 83,0%
GDPVal-AA v2 Elo 1421
Truy xuất ngữ cảnh 128k token 91,8%
Truy xuất điểm ở ngữ cảnh 1M token 54,0%

Với lập trình, mô hình đạt 58,7% trên SWE-Bench Pro, bài kiểm tra khả năng giải quyết vấn đề GitHub thực tế trong các kho sản phẩm. Trên Terminal-bench 2.1, bài kiểm tra chạy lệnh trong terminal thực, mô hình đạt 78,0%.

Khả năng sử dụng máy tính được cải thiện đáng kể:

Gemini 3.5 Flash: 78,4% trên OSWorld-Verified
Gemini 3.6 Flash: 83,0% trên OSWorld-Verified
Enter fullscreen mode Exit fullscreen mode

Đây là tín hiệu đáng chú ý nếu bạn xây dựng agent tương tác với desktop hoặc ứng dụng thực.

Với ngữ cảnh dài, đừng giả định rằng mô hình có thể truy xuất hoàn hảo ở mọi độ dài. Độ chính xác trung bình là 91,8% ở 128k token, nhưng giảm xuống 54,0% khi truy xuất điểm trong cửa sổ 1M token đầy đủ.

Cách kiểm tra thực tế:

  1. Chuẩn bị tài liệu có các dữ kiện hoặc “needle” ở nhiều vị trí.
  2. Chạy cùng một bộ câu hỏi ở 128k, 256k, 512k và 1M token.
  3. Lưu tỷ lệ truy xuất đúng, độ trễ và token tiêu thụ.
  4. Đặt giới hạn ngữ cảnh phù hợp với yêu cầu chất lượng của hệ thống.

Tổng quan về giá

Gemini 3.6 Flash có giá:

Đầu vào: 1,50 USD / 1M token
Đầu ra: 7,50 USD / 1M token
Enter fullscreen mode Exit fullscreen mode

Giá token đầu ra bao gồm token suy nghĩ. Vì vậy, token suy luận không xuất hiện trong câu trả lời cuối cùng vẫn được tính vào hóa đơn.

Bộ nhớ đệm ngữ cảnh có giá:

0,15 USD / 1M token
+ 1,00 USD / 1M token mỗi giờ lưu trữ
Enter fullscreen mode Exit fullscreen mode

Context caching phù hợp khi bạn cần gửi lặp lại cùng một prompt lớn, chẳng hạn như:

  • Tài liệu sản phẩm cố định
  • Bộ hướng dẫn hệ thống dài
  • Chính sách nội bộ
  • Toàn bộ schema hoặc định nghĩa công cụ

Có cấp miễn phí qua Google AI Studio, nhưng cấp này có giới hạn tốc độ. Google có thể sử dụng dữ liệu ở cấp miễn phí để cải thiện sản phẩm, vì vậy nên dùng để tạo mẫu thay vì xử lý dữ liệu production nhạy cảm.

Xem thêm:

Cách truy cập Gemini 3.6 Flash

Bạn có thể truy cập mô hình qua các kênh sau:

  • API Gemini qua Google AI Studio: lấy API key và gọi gemini-3.6-flash từ REST client hoặc SDK.
  • Google Antigravity: nền tảng phát triển agent của Google.
  • Gemini Enterprise Agent Platform: dành cho nhóm xây dựng agent được quản lý trong doanh nghiệp.
  • Ứng dụng Gemini: dùng để trò chuyện trực tiếp.

Với đa số developer, API là phương án quan trọng nhất.

Quy trình triển khai cơ bản:

  1. Tạo API key trong Google AI Studio.
  2. Lưu key trong biến môi trường.
  3. Gọi model ID gemini-3.6-flash.
  4. Ghi log token, độ trễ và lỗi.
  5. Thêm bài kiểm thử regression trước khi chuyển lưu lượng production.

Tham khảo:

Vị trí của Gemini 3.6 Flash trong danh mục sản phẩm của Google

Có thể xem dòng Flash như một thang bậc giữa chi phí, tốc độ và chất lượng.

Mô hình Phù hợp với
Gemini 3.5 Flash-Lite Tác vụ khối lượng lớn, nhạy độ trễ, không cần chất lượng tối đa
Gemini 3.6 Flash Tác vụ khó hơn, agent, code và output cần độ tin cậy cao hơn

Gemini 3.5 Flash-Lite có giá:

Đầu vào: 0,30 USD / 1M token
Đầu ra: 2,50 USD / 1M token
Enter fullscreen mode Exit fullscreen mode

Mô hình này nhanh, khoảng 350 token đầu ra mỗi giây, phù hợp cho phân loại, trích xuất đơn giản hoặc workflow có lưu lượng rất lớn.

Gemini 3.5 Pro chưa được phát hành công khai. Google cho biết họ vẫn thử nghiệm mô hình này với đối tác. Google cũng hé lộ một đợt đào tạo trước Gemini 4, nhưng đây chưa phải sản phẩm bạn có thể sử dụng ngay.

Nếu cần nền tảng về thế hệ trước, xem Gemini 3.5 là gì.

Kiểm tra Gemini 3.6 Flash trong Apidog

Trang model cung cấp benchmark, nhưng bạn vẫn cần kiểm tra phản hồi với prompt, dữ liệu và độ dài ngữ cảnh thực tế của hệ thống.

Apidog là API client và nền tảng kiểm thử. Bạn có thể dùng nó để tạo, gửi và kiểm tra các yêu cầu Gemini như mọi REST API khác.

Thiết lập yêu cầu kiểm thử

  1. Tạo yêu cầu POST đến endpoint Gemini API.
  2. Đặt model là gemini-3.6-flash.
  3. Lưu API key trong biến môi trường Apidog, không dán trực tiếp vào URL hoặc request dùng chung.
  4. Gửi request và kiểm tra response.
  5. Lưu request thành bài kiểm thử hồi quy.

Ví dụ cấu trúc kiểm thử cần có:

- HTTP status phải là 200
- Response phải có trường nội dung mong đợi
- JSON không được thay đổi schema quan trọng
- Độ trễ không vượt quá ngưỡng chấp nhận được
- Token sử dụng không vượt ngân sách của tác vụ
Enter fullscreen mode Exit fullscreen mode

Bạn nên tạo ít nhất ba nhóm test case:

Nhóm test Mục tiêu
Happy path Xác minh output cơ bản đúng định dạng và nội dung
Long context Kiểm tra truy xuất khi prompt hoặc tài liệu lớn
Regression Phát hiện thay đổi về schema, chất lượng hoặc độ trễ sau cập nhật model

Sau đó, lưu bộ test và lên lịch chạy để theo dõi thay đổi theo thời gian.

Apidog không chạy model và không phải framework AI. Nó giúp bạn xây dựng request, gửi request, xác thực response và phát hiện thay đổi theo tiêu chuẩn bạn định nghĩa. Khi Google cập nhật dòng Flash, bộ test đã lưu sẽ cho biết các hành vi mà hệ thống phụ thuộc có thay đổi hay không.

Tải xuống Apidog để thiết lập yêu cầu đầu tiên.

Câu hỏi thường gặp

Gemini 3.6 Flash có miễn phí không?

Có cấp miễn phí qua Google AI Studio, nhưng có giới hạn tốc độ và phù hợp cho tạo mẫu. Google có thể sử dụng dữ liệu cấp miễn phí để cải thiện sản phẩm. Với production, giá là 1,50 USD cho mỗi triệu token đầu vào và 7,50 USD cho mỗi triệu token đầu ra.

Gemini 3.6 Flash có tốt hơn Gemini 3.5 Flash không?

Với hầu hết tác vụ, có. Gemini 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra, giảm giá đầu ra từ 9,00 USD xuống 7,50 USD cho mỗi triệu token, đồng thời cải thiện về code và sử dụng máy tính. Điểm OSWorld-Verified tăng từ 78,4% lên 83,0%.

Gemini 3.5 Pro đã ra mắt chưa?

Chưa. Google cho biết họ vẫn đang thử nghiệm Gemini 3.5 Pro với đối tác. Gemini 4 mới chỉ được hé lộ, chưa phát hành.

ID mô hình là gì?

ID là:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Không nhầm với:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Đây là model Flash-Lite rẻ hơn và thuộc cấp khác.

Gemini 3.6 Flash không thể làm gì?

Mô hình chỉ sinh văn bản, nên không tạo hình ảnh, âm thanh hoặc video dù có thể đọc chúng làm đầu vào. Khả năng truy xuất cũng giảm ở gần cuối cửa sổ ngữ cảnh 1M token, đạt khoảng 54,0% trong bài kiểm tra truy xuất điểm ở độ dài đầy đủ.

Gemini 3.6 Flash là lựa chọn phù hợp cho phần lớn lưu lượng API Gemini cần cân bằng chi phí, tốc độ và chất lượng. Trước khi chuyển lưu lượng lớn, hãy chạy một bộ kiểm thử API đã lưu với các prompt, context length và tiêu chí chất lượng mà hệ thống của bạn thực sự sử dụng.