
Sebastian PetrusGemini 3.6 Flash là mô hình chủ lực mới của Google, được phát hành rộng rãi vào ngày 21 tháng 7 năm...
Gemini 3.6 Flash là mô hình chủ lực mới của Google, được phát hành rộng rãi vào ngày 21 tháng 7 năm 2026. Mô hình này rẻ hơn và hiệu quả token hơn Gemini 3.5 Flash mà nó thay thế, phù hợp khi bạn cần xử lý lưu lượng API lớn với chất lượng ổn định mà không phải trả mức giá của một mô hình cao cấp.
Bài viết này tập trung vào những điểm cần triển khai: khác biệt so với Gemini 3.5 Flash, thông số kỹ thuật, giá, cách gọi API và cách thiết lập kiểm thử hồi quy để xác minh phản hồi thực tế của mô hình.
Gemini 3.6 Flash là mô hình thông lượng cao, cấp trung trong họ Gemini của Google. Đây là lựa chọn cho phần lớn lưu lượng production hằng ngày, chẳng hạn như:
Mô hình nhận đầu vào là văn bản, hình ảnh, video, âm thanh và PDF trong cùng một yêu cầu. Đầu ra chỉ là văn bản.
Google phát hành Gemini 3.6 Flash cùng hai mô hình khác vào ngày 21 tháng 7 năm 2026:
Xem thêm:
Điểm dễ gây nhầm lẫn là số phiên bản không đồng nhất:
gemini-3.6-flash
gemini-3.5-flash-lite
gemini-3.5-flash-cyber
gemini-3.6-flash và gemini-3.5-flash-lite là hai cấp mô hình khác nhau, không phải lỗi đánh máy. Khi thay đổi model ID trong production, hãy kiểm tra chính xác tên model trong cấu hình và bộ kiểm thử của bạn.
Google công bố thông tin trên blog của Google. Thẻ mô hình có trên trang DeepMind Flash.
Thay đổi quan trọng nhất là hiệu quả token. Gemini 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra so với Gemini 3.5 Flash khi hoàn thành cùng một tác vụ.
Điều này tác động trực tiếp đến hai yếu tố:
Google cũng giảm giá token đầu ra:
| Mô hình | Giá đầu ra / 1M token |
|---|---|
| Gemini 3.5 Flash | 9,00 USD |
| Gemini 3.6 Flash | 7,50 USD |
Gemini 3.6 Flash cũng cải thiện khả năng viết mã, sử dụng máy tính và thực hiện workflow nhiều bước với ít vòng suy luận hoặc lệnh gọi công cụ hơn.
Nếu bạn vận hành agent, hãy đo ít nhất các chỉ số sau trước và sau khi chuyển model:
Xem phân tích chuyển đổi lưu lượng tại Gemini 3.6 Flash so với 3.5 Flash.
| Thuộc tính | Gemini 3.6 Flash |
|---|---|
| ID mô hình | gemini-3.6-flash |
| Cửa sổ ngữ cảnh đầu vào | 1M token |
| Đầu ra tối đa | 64k token |
| Hình thức đầu vào | Văn bản, hình ảnh, video, âm thanh, PDF |
| Đầu ra | Chỉ văn bản |
| Giá đầu vào | 1,50 USD / 1M token |
| Giá đầu ra | 7,50 USD / 1M token, bao gồm token suy nghĩ |
| Cấp miễn phí | Có, qua Google AI Studio, có giới hạn tốc độ |
| Ra mắt | 21 tháng 7 năm 2026 |
Cửa sổ ngữ cảnh 1M token cho phép bạn gửi tài liệu lớn, bản ghi dài hoặc lượng lớn mã nguồn trong một lần gọi. Tuy nhiên, đầu ra bị giới hạn ở 64k token, vì vậy cần chia tác vụ thành nhiều lượt nếu bạn phải tạo nội dung rất dài.
Ví dụ, thay vì yêu cầu mô hình tạo toàn bộ tài liệu dài trong một phản hồi, hãy chia workflow thành:
Các benchmark không phải là cam kết cho workload của bạn, nhưng chúng giúp xác định loại tác vụ nên thử nghiệm trước.
Theo số liệu Google báo cáo:
| Benchmark | Gemini 3.6 Flash |
|---|---|
| SWE-Bench Pro | 58,7% |
| DeepSWE v1.1 | 49% |
| Terminal-bench 2.1 | 78,0% |
| OSWorld-Verified | 83,0% |
| GDPVal-AA v2 Elo | 1421 |
| Truy xuất ngữ cảnh 128k token | 91,8% |
| Truy xuất điểm ở ngữ cảnh 1M token | 54,0% |
Với lập trình, mô hình đạt 58,7% trên SWE-Bench Pro, bài kiểm tra khả năng giải quyết vấn đề GitHub thực tế trong các kho sản phẩm. Trên Terminal-bench 2.1, bài kiểm tra chạy lệnh trong terminal thực, mô hình đạt 78,0%.
Khả năng sử dụng máy tính được cải thiện đáng kể:
Gemini 3.5 Flash: 78,4% trên OSWorld-Verified
Gemini 3.6 Flash: 83,0% trên OSWorld-Verified
Đây là tín hiệu đáng chú ý nếu bạn xây dựng agent tương tác với desktop hoặc ứng dụng thực.
Với ngữ cảnh dài, đừng giả định rằng mô hình có thể truy xuất hoàn hảo ở mọi độ dài. Độ chính xác trung bình là 91,8% ở 128k token, nhưng giảm xuống 54,0% khi truy xuất điểm trong cửa sổ 1M token đầy đủ.
Cách kiểm tra thực tế:
Gemini 3.6 Flash có giá:
Đầu vào: 1,50 USD / 1M token
Đầu ra: 7,50 USD / 1M token
Giá token đầu ra bao gồm token suy nghĩ. Vì vậy, token suy luận không xuất hiện trong câu trả lời cuối cùng vẫn được tính vào hóa đơn.
Bộ nhớ đệm ngữ cảnh có giá:
0,15 USD / 1M token
+ 1,00 USD / 1M token mỗi giờ lưu trữ
Context caching phù hợp khi bạn cần gửi lặp lại cùng một prompt lớn, chẳng hạn như:
Có cấp miễn phí qua Google AI Studio, nhưng cấp này có giới hạn tốc độ. Google có thể sử dụng dữ liệu ở cấp miễn phí để cải thiện sản phẩm, vì vậy nên dùng để tạo mẫu thay vì xử lý dữ liệu production nhạy cảm.
Xem thêm:
Bạn có thể truy cập mô hình qua các kênh sau:
gemini-3.6-flash từ REST client hoặc SDK.Với đa số developer, API là phương án quan trọng nhất.
Quy trình triển khai cơ bản:
gemini-3.6-flash.Tham khảo:
Có thể xem dòng Flash như một thang bậc giữa chi phí, tốc độ và chất lượng.
| Mô hình | Phù hợp với |
|---|---|
| Gemini 3.5 Flash-Lite | Tác vụ khối lượng lớn, nhạy độ trễ, không cần chất lượng tối đa |
| Gemini 3.6 Flash | Tác vụ khó hơn, agent, code và output cần độ tin cậy cao hơn |
Gemini 3.5 Flash-Lite có giá:
Đầu vào: 0,30 USD / 1M token
Đầu ra: 2,50 USD / 1M token
Mô hình này nhanh, khoảng 350 token đầu ra mỗi giây, phù hợp cho phân loại, trích xuất đơn giản hoặc workflow có lưu lượng rất lớn.
Gemini 3.5 Pro chưa được phát hành công khai. Google cho biết họ vẫn thử nghiệm mô hình này với đối tác. Google cũng hé lộ một đợt đào tạo trước Gemini 4, nhưng đây chưa phải sản phẩm bạn có thể sử dụng ngay.
Nếu cần nền tảng về thế hệ trước, xem Gemini 3.5 là gì.
Trang model cung cấp benchmark, nhưng bạn vẫn cần kiểm tra phản hồi với prompt, dữ liệu và độ dài ngữ cảnh thực tế của hệ thống.
Apidog là API client và nền tảng kiểm thử. Bạn có thể dùng nó để tạo, gửi và kiểm tra các yêu cầu Gemini như mọi REST API khác.
POST đến endpoint Gemini API.gemini-3.6-flash.Ví dụ cấu trúc kiểm thử cần có:
- HTTP status phải là 200
- Response phải có trường nội dung mong đợi
- JSON không được thay đổi schema quan trọng
- Độ trễ không vượt quá ngưỡng chấp nhận được
- Token sử dụng không vượt ngân sách của tác vụ
Bạn nên tạo ít nhất ba nhóm test case:
| Nhóm test | Mục tiêu |
|---|---|
| Happy path | Xác minh output cơ bản đúng định dạng và nội dung |
| Long context | Kiểm tra truy xuất khi prompt hoặc tài liệu lớn |
| Regression | Phát hiện thay đổi về schema, chất lượng hoặc độ trễ sau cập nhật model |
Sau đó, lưu bộ test và lên lịch chạy để theo dõi thay đổi theo thời gian.
Apidog không chạy model và không phải framework AI. Nó giúp bạn xây dựng request, gửi request, xác thực response và phát hiện thay đổi theo tiêu chuẩn bạn định nghĩa. Khi Google cập nhật dòng Flash, bộ test đã lưu sẽ cho biết các hành vi mà hệ thống phụ thuộc có thay đổi hay không.
Tải xuống Apidog để thiết lập yêu cầu đầu tiên.
Có cấp miễn phí qua Google AI Studio, nhưng có giới hạn tốc độ và phù hợp cho tạo mẫu. Google có thể sử dụng dữ liệu cấp miễn phí để cải thiện sản phẩm. Với production, giá là 1,50 USD cho mỗi triệu token đầu vào và 7,50 USD cho mỗi triệu token đầu ra.
Với hầu hết tác vụ, có. Gemini 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra, giảm giá đầu ra từ 9,00 USD xuống 7,50 USD cho mỗi triệu token, đồng thời cải thiện về code và sử dụng máy tính. Điểm OSWorld-Verified tăng từ 78,4% lên 83,0%.
Chưa. Google cho biết họ vẫn đang thử nghiệm Gemini 3.5 Pro với đối tác. Gemini 4 mới chỉ được hé lộ, chưa phát hành.
ID là:
gemini-3.6-flash
Không nhầm với:
gemini-3.5-flash-lite
Đây là model Flash-Lite rẻ hơn và thuộc cấp khác.
Mô hình chỉ sinh văn bản, nên không tạo hình ảnh, âm thanh hoặc video dù có thể đọc chúng làm đầu vào. Khả năng truy xuất cũng giảm ở gần cuối cửa sổ ngữ cảnh 1M token, đạt khoảng 54,0% trong bài kiểm tra truy xuất điểm ở độ dài đầy đủ.
Gemini 3.6 Flash là lựa chọn phù hợp cho phần lớn lưu lượng API Gemini cần cân bằng chi phí, tốc độ và chất lượng. Trước khi chuyển lưu lượng lớn, hãy chạy một bộ kiểm thử API đã lưu với các prompt, context length và tiêu chí chất lượng mà hệ thống của bạn thực sự sử dụng.