Mục lục
TL;DR: Google vừa phát hành Gemini 3.8 Flash với khả năng nhận và phân tích video, âm thanh trực tiếp, một điểm khác biệt mà các mô hình như GPT-6 Astra và Claude Fable 5.1 chưa hỗ trợ.
Điểm đáng chú ý nhất của Gemini 3.8 Flash không chỉ là mô hình có ngữ cảnh hơn 1 triệu token, mà là cách nó xử lý video dài. Google gọi phương thức này là “agentic video understanding”, tức AI có thể tự xác định đoạn thời gian, khung hình, bản chép lời hoặc phần âm thanh nào cần xem để trả lời câu hỏi.
Điều này mở rộng các tác vụ mà người dùng có thể giao trực tiếp cho mô hình: tìm thời điểm một chủ đề được nhắc đến trong bài giảng, xác định chuyện xảy ra ngay trước một cảnh, hoặc kiểm tra nội dung trên màn hình khi người nói đề cập đến một ý cụ thể. Thay vì phải tự tua video hoặc tách video thành ảnh và văn bản trước, người dùng có thể đặt câu hỏi dựa trên toàn bộ nội dung.
Gemini 3.8 Flash nhận nhiều loại dữ liệu đầu vào
Gemini 3.8 Flash hỗ trợ văn bản, hình ảnh, video, âm thanh và tệp PDF làm đầu vào; đây là một hướng mở rộng bên cạnh các tính năng Gemini tích hợp trong hệ sinh thái Google. Context window, hay lượng thông tin mô hình có thể xem xét trong một lần xử lý, đạt hơn 1 triệu token. Token là đơn vị dữ liệu mà mô hình AI dùng để đọc và xử lý nội dung.
Với video, Google cho biết Gemini không chỉ biến một clip thành một số ảnh tĩnh rồi suy luận từ các ảnh đó. Mô hình có thể kết hợp khung hình, âm thanh và mốc thời gian để hiểu diễn biến trong video. Đây là yếu tố quan trọng với các nội dung mà câu trả lời phụ thuộc vào thứ tự sự kiện hoặc phần lời nói đi kèm hình ảnh.
Chẳng hạn, một câu hỏi như “người trình bày nhắc tới chủ đề này ở đâu?” cần AI đối chiếu lời nói với timeline. Câu hỏi “ngay trước khi một người bước vào phòng đã có chuyện gì?” lại đòi hỏi mô hình theo dõi chuỗi hình ảnh theo thời gian. Google cho biết Gemini 3.8 Flash có thể trả lời theo những thời điểm cụ thể trong video.
Agentic video understanding hoạt động như thế nào
“Agentic” ở đây mô tả khả năng mô hình chủ động chọn bước cần thực hiện, thay vì xử lý mọi phần dữ liệu theo cùng một cách. Theo Google, khi nhận video dài, Gemini 3.8 Flash có thể quyết định cần tìm bản chép lời, xem khung hình hay kiểm tra âm thanh ở một đoạn nhất định để hoàn thành yêu cầu.
Công ty nói cách tiếp cận này có thể giảm tới 88% số token dùng khi xử lý video dài, đồng thời nâng chất lượng khoảng 7%. Đây là số liệu do Google công bố, nên chưa cho biết rõ hiệu quả sẽ thay đổi ra sao với từng loại video, độ dài, ngôn ngữ hay tác vụ thực tế.
Nếu hiệu quả này được duy trì ngoài các thử nghiệm của công ty, lợi ích có thể nằm ở tốc độ và chi phí xử lý. Video thường chứa lượng dữ liệu lớn hơn nhiều so với văn bản; việc chỉ truy xuất các phần liên quan thay vì phân tích đồng đều toàn bộ video có thể giúp AI phản hồi hiệu quả hơn.
Khác biệt với GPT-6 Astra và Claude Fable 5.1
GPT-6 Astra được nêu có context window 1,05 triệu token, nhỉnh hơn Gemini 3.8 Flash về dung lượng ngữ cảnh. Tuy vậy, theo tài liệu OpenAI được dẫn trong nguồn, mô hình này hỗ trợ văn bản và hình ảnh nhưng không hỗ trợ đầu vào video hoặc âm thanh.
Claude Fable 5.1 có context window 1 triệu token và được mô tả là mạnh trong việc hiểu thông tin thị giác như sơ đồ, biểu đồ, bảng biểu. Nhưng theo thông tin năng lực đầu vào được nêu trong nguồn, mô hình này nhận văn bản và hình ảnh để tạo văn bản, thay vì nhận video và âm thanh trực tiếp như Gemini.
Người dùng vẫn có thể trích xuất khung hình hoặc tạo bản chép lời từ video trước khi đưa sang các mô hình khác. Tuy nhiên, đó là một quy trình bổ sung và có thể làm mất liên kết giữa hình ảnh, lời nói và mốc thời gian. Điểm khác biệt của Gemini 3.8 Flash là các thành phần này được đưa vào mô hình như một tác vụ đa phương thức thống nhất.
Vì sao đáng chú ý?
Cạnh tranh giữa các mô hình AI không chỉ nằm ở việc trả lời câu hỏi hay viết mã tốt hơn. Khi dữ liệu đầu vào trong công việc và đời sống ngày càng gồm họp trực tuyến, video hướng dẫn, bài giảng, bản ghi màn hình và nội dung đa phương tiện, khả năng hiểu trực tiếp những định dạng này sẽ quyết định AI có thể tham gia sâu đến đâu vào quy trình thực tế.
Gemini 3.8 Flash cũng cho thấy lợi thế không nhất thiết chỉ thuộc về mô hình lớn nhất hoặc đắt nhất. Google định vị dòng Flash cho tốc độ và hiệu quả chi phí; việc đưa hiểu video theo hướng chủ động vào dòng này có thể khiến nó phù hợp hơn cho một số nhu cầu tra cứu và phân tích nội dung dài. Dù vậy, một tính năng riêng lẻ chưa đủ để kết luận mô hình nào tốt hơn toàn diện, bởi GPT-6 Astra và Claude Fable 5.1 vẫn được định vị cho các dạng suy luận và tác vụ dài hạn khác.
Skills Bridge tổng hợp

