Mục lục
Ngày 21/07/2026, Google chính thức giới thiệu ba mô hình mới thuộc dòng Gemini Flash, bao gồm Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber.
Nếu các thế hệ mô hình trước đây chủ yếu tập trung vào việc nâng cao trí thông minh và khả năng suy luận, những cập nhật lần này hướng đến một bài toán thực tế hơn: làm thế nào để xây dựng AI Agent có thể hoạt động nhanh, ổn định và tiết kiệm chi phí khi được triển khai ở quy mô lớn.
Bài viết sẽ phân tích đặc điểm chính của từng mô hình trong hệ sinh thái Gemini mới của Google và giới thiệu những bản demo thực tế cùng cách sử dụng từng mô hình.
1. Gemini 3.6 Flash

Gemini 3.6 Flash được Google định vị là mô hình chủ lực, hay “workhorse model”, dành cho các tác vụ cần sự cân bằng giữa tốc độ, chất lượng và chi phí. Mô hình được phát triển dựa trên phản hồi từ các nhà phát triển và khách hàng đã sử dụng Gemini 3.5 Flash.
Thay đổi quan trọng nhất không chỉ nằm ở việc nâng cao năng lực xử lý, mà còn ở khả năng hoàn thành tác vụ với ít tài nguyên hơn.
Theo các chỉ số từ Artificial Analysis Index được Google dẫn lại, Gemini 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra so với Gemini 3.5 Flash. Với một số bài kiểm tra lập trình như DeepSWE, mức giảm token được ghi nhận có thể lên đến 65%.
Việc giảm token đầu ra mang lại hai lợi ích trực tiếp:
Thứ nhất, người dùng nhận được câu trả lời ngắn gọn và tập trung hơn, hạn chế tình trạng mô hình giải thích dài dòng hoặc lặp lại thông tin không cần thiết.
Thứ hai, nhà phát triển có thể giảm chi phí vận hành khi triển khai hàng nghìn hoặc hàng triệu yêu cầu mỗi ngày.
Gemini 3.6 Flash không chỉ sử dụng ít token hơn mà còn cải thiện hiệu năng trên nhiều nhóm tác vụ:
- Lập trình: DeepSWE đạt 49%, tăng từ 37%; MLE Bench đạt 63,9%, tăng từ 49,7%.
- Sử dụng máy tính: OSWorld-Verified đạt 83%, cao hơn mức 78,4% của Flash 3.5.
- Công việc tri thức: GDPval-AA v2 đạt 1.421 điểm, so với 1.349 điểm của phiên bản trước.
- Phân tích đa phương thức: Hỗ trợ đọc tài liệu, biểu đồ, dữ liệu tài chính và soạn thảo báo cáo.
- Di chuyển mã: Điều phối nhiều AI Agent với độ trễ thấp và chất lượng cao hơn.
- Quy trình sáng tạo: Hỗ trợ xây dựng công cụ trích xuất kết cấu ảnh 3D và studio tương tác trên canvas.
Về chi phí sử dụng, Google công bố mức giá của Gemini 3.6 Flash là 1,5 USD cho mỗi một triệu token đầu vào và 7,5 USD cho mỗi một triệu token đầu ra. Mức giá này thấp hơn Gemini 3.5 Flash, giúp giảm tổng chi phí cho mỗi nhiệm vụ do AI Agent thực hiện.
Để minh họa rõ hơn khả năng của Gemini 3.6 Flash, Google đã giới thiệu một số bản demo trình diễn trải rộng từ phân tích tài chính, lập trình đến thiết kế và quy trình sáng tạo 3D.
- Phân tích dữ liệu tài chính và bản ghi nội dung: Gemini 3.6 Flash có thể đọc, phân loại và phân tích dữ liệu tài chính cùng các bản ghi nội dung hiệu quả hơn Gemini 3.5 Flash. Mô hình không chỉ trích xuất các con số riêng lẻ mà còn có thể đối chiếu nhiều nguồn thông tin, xác định nội dung quan trọng và hỗ trợ tổng hợp kết quả phục vụ quá trình phân tích.

- Di chuyển mã nguồn bằng hệ thống đa tác nhân: Trong một bản trình diễn khác trên AGY, Gemini 3.6 Flash sử dụng cơ chế điều phối đa tác nhân để thực hiện quá trình di chuyển mã nguồn. Thay vì giao toàn bộ nhiệm vụ cho một Agent duy nhất, hệ thống có thể phân chia công việc cho nhiều Agent phụ. Mỗi Agent xử lý một phần của dự án, chẳng hạn như phân tích cấu trúc hiện tại, chỉnh sửa từng nhóm tệp, kiểm tra lỗi hoặc xác minh kết quả sau khi thay đổi.

- Xây dựng công cụ trích xuất kết cấu ảnh cho quy trình 3D: Gemini 3.6 Flash cũng được sử dụng trong ứng dụng Gemini để hỗ trợ phát triển một công cụ trích xuất kết cấu ảnh phục vụ quy trình làm việc 3D. Thông qua canvas, người dùng có thể xây dựng một công cụ giúp phân tích hình ảnh tham chiếu và tách các bề mặt hoặc kết cấu ảnh cần thiết để sử dụng trong quá trình thiết kế tài sản 3D.

- Tạo studio chủ đề tương tác bằng khả năng hiểu hình ảnh: Trong môi trường AGY, Gemini 3.6 Flash còn được kết hợp với trình soạn thảo ngoại tuyến tldraw để xây dựng các studio chủ đề có khả năng tương tác. Nhờ khả năng hiểu hình ảnh và bố cục, mô hình có thể hỗ trợ tổ chức các thành phần trên canvas, diễn giải mối quan hệ giữa chúng và phát triển những không gian trực quan mà người dùng có thể tiếp tục chỉnh sửa.

2. Gemini 3.5 Flash-Lite
Nếu Gemini 3.6 Flash được thiết kế cho những tác vụ phức tạp, Gemini 3.5 Flash-Lite lại tập trung vào tốc độ, độ trễ thấp và khả năng xử lý lưu lượng lớn. Đây là mô hình nhanh nhất trong dòng Gemini 3.5.
Theo Artificial Analysis Index được Google dẫn lại, Gemini 3.5 Flash-Lite có thể tạo khoảng 350 token đầu ra mỗi giây. Mô hình có giá 0,30 USD cho mỗi một triệu token đầu vào và 2,50 USD cho mỗi một triệu token đầu ra.
Mức giá này phù hợp với các hệ thống phải xử lý hàng loạt tác vụ có cấu trúc tương đối rõ ràng, chẳng hạn:
- Tìm kiếm bằng AI Agent
- Phân loại và xử lý tài liệu
- Trích xuất thông tin sản phẩm
- Dịch và tóm tắt hóa đơn
- Phân tích tập dữ liệu thương mại điện tử
- Tạo nhiều phương án nội dung hoặc thiết kế
- Xử lý các yêu cầu lặp lại với khối lượng lớn
Trước đây, doanh nghiệp thường phải lựa chọn giữa một mô hình nhanh nhưng hạn chế về chất lượng và một mô hình mạnh nhưng tốn nhiều chi phí.
Gemini 3.5 Flash-Lite được xây dựng để thu hẹp khoảng cách này. Mô hình có thể đảm nhận những tác vụ cần tốc độ cao mà vẫn duy trì khả năng lập trình, hiểu ngữ cảnh dài và thực hiện các nhiệm vụ Agentic.

Trong Terminal-Bench 2.1, mô hình đạt 54%, cao hơn mức 31% của Gemini 3.1 Flash-Lite. Với bài kiểm tra ngữ cảnh dài GDM-MRCR v2, kết quả tăng từ 60,1% lên 72,2%.

Đáng chú ý, Gemini 3.5 Flash-Lite đạt 54,2% trên SWE-Bench Pro, cao hơn mức 49,6% của Gemini 3 Flash; đồng thời đạt 74% trên OSWorld-Verified, so với 65,1%.

Một trong những điểm quan trọng của Gemini 3.5 Flash-Lite là khả năng điều chỉnh mức độ tư duy theo từng loại công việc. Không phải yêu cầu nào cũng cần AI dành nhiều thời gian để suy luận.
Ví dụ, việc phân loại một hóa đơn hoặc trích xuất tên sản phẩm có thể được xử lý nhanh với mức tư duy tối thiểu. Ngược lại, một nhiệm vụ gồm nhiều bước và nhiều Agent phụ có thể cần mức suy luận cao hơn.
Nhà phát triển có thể cấu hình mô hình theo hai hướng:
- Ưu tiên độ trễ thấp và chi phí thấp cho các tác vụ đơn giản, khối lượng lớn.
- Tăng mức độ tư duy khi cần xử lý quy trình nhiều bước hoặc phối hợp các Agent phụ.
Cách tiếp cận này giúp doanh nghiệp không phải sử dụng cùng một mức tài nguyên cho mọi yêu cầu.
Các bản demo thực tế cho thấy Gemini 3.5 Flash-Lite có thể:
- Xử lý dữ liệu lớn: Trích xuất và tổng hợp đặc điểm sản phẩm từ tập dữ liệu thương mại điện tử.

- Hỗ trợ hệ thống đa tác nhân: Phối hợp với Gemini 3.6 Flash để tạo nhanh 25 ý tưởng thiết kế web khác nhau.

- Xử lý tài liệu đa phương thức: Dịch và tóm tắt nội dung biên lai ở quy mô lớn.

- Phát triển trò chơi: Tạo và thử nghiệm đồng thời nhiều phương án để nhanh chóng hoàn thiện sản phẩm.

Trong một hệ thống thực tế, Gemini 3.6 Flash có thể đóng vai trò Agent điều phối chính, chịu trách nhiệm lập kế hoạch và đưa ra quyết định. Gemini 3.5 Flash-Lite có thể đảm nhận các nhiệm vụ nhỏ hơn như phân loại dữ liệu, tạo phương án, trích xuất thông tin hoặc xử lý yêu cầu hàng loạt.
Đây là mô hình vận hành gần với cách một đội ngũ làm việc: nhiệm vụ phức tạp được chuyển đến người có năng lực chuyên sâu, còn các công việc lặp lại được xử lý bằng nguồn lực nhanh và tiết kiệm hơn. Việc phân vai như vậy là một suy luận từ cách Google mô tả hai dòng mô hình và các trường hợp sử dụng của chúng.
3. Gemini 3.5 Flash Cyber
Bên cạnh hai mô hình đa dụng, Google còn giới thiệu Gemini 3.5 Flash Cyber, phiên bản được tinh chỉnh chuyên biệt cho an ninh mạng.
Theo Google, các mô hình AI hiện nay đã có khả năng phát hiện lỗ hổng nhanh hơn tốc độ mà nhiều hệ thống có thể sửa chữa chúng. Điều này tạo ra một bài toán mới: tổ chức không chỉ cần tìm thấy vấn đề, mà còn phải xác minh và khắc phục chúng ở quy mô lớn.
Gemini 3.5 Flash Cyber được xây dựng trên nền tảng Gemini 3.5 Flash và được huấn luyện thêm để:
- Tìm kiếm lỗ hổng trong mã nguồn.
- Xác minh liệu một lỗ hổng có thực sự tồn tại hay không.
- Đề xuất hoặc tạo bản vá.
- Phân tích các vấn đề bảo mật với chi phí token thấp hơn những mô hình lớn.
Mô hình được sử dụng bên trong CodeMender, Agent bảo mật mã nguồn của Google. CodeMender có thể vận hành nhiều Agent Gemini 3.5 Flash Cyber cùng lúc. Mỗi Agent phụ trách một phần của quá trình phân tích, sau đó kết quả được tổng hợp thành một báo cáo chung.
Theo Google, sự kết hợp này đạt kết quả cạnh tranh với những hệ thống hàng đầu trên CyberGym, một bộ tiêu chuẩn đánh giá khả năng phát hiện và xử lý lỗ hổng an ninh mạng. Tuy nhiên, công nghệ an ninh mạng có tính chất sử dụng kép. Cùng một khả năng có thể giúp đội ngũ phòng thủ sửa lỗi, nhưng cũng có nguy cơ bị lợi dụng để tìm điểm yếu phục vụ mục đích tấn công.
Vì vậy, Gemini 3.5 Flash Cyber chưa được phát hành rộng rãi. Mô hình dự kiến chỉ được cung cấp cho các cơ quan chính phủ và đối tác đáng tin cậy thông qua CodeMender trong một chương trình thử nghiệm giới hạn.
4. Truy Cập Các Mô Hình Gemini Mới
Gemini 3.6 Flash và Gemini 3.5 Flash-Lite đã bắt đầu được cung cấp từ ngày 21/07/2026.
- Đối với nhà phát triển, hai mô hình có thể được truy cập thông qua Gemini API trên Google AI Studio và Android Studio. Gemini 3.6 Flash cũng được tích hợp vào Google Antigravity.
- Đối với khách hàng doanh nghiệp, các mô hình được cung cấp thông qua Gemini Enterprise Agent Platform. Gemini 3.6 Flash đồng thời có mặt trong ứng dụng Gemini Enterprise.
- Người dùng phổ thông có thể trải nghiệm các mô hình thông qua ứng dụng Gemini. Google cũng đang bắt đầu đưa Gemini 3.5 Flash-Lite vào Google Search.
Lời Kết
Sự xuất hiện của Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber cho thấy cuộc đua AI đang bước sang một giai đoạn mới. Doanh nghiệp không còn chỉ quan tâm mô hình nào thông minh hơn, mà còn cần biết mô hình đó có thể hoàn thành công việc nhanh đến đâu, chính xác đến mức nào và với chi phí bao nhiêu.
Thay vì sử dụng một mô hình lớn cho mọi tác vụ, Google đang hướng đến một hệ thống gồm nhiều mô hình chuyên biệt: Gemini 3.6 Flash xử lý các nhiệm vụ phức tạp, Gemini 3.5 Flash-Lite đảm nhận khối lượng công việc lớn với tốc độ cao, còn Gemini 3.5 Flash Cyber tập trung vào bảo mật mã nguồn.
