Mục lục
TL;DR: Google cho biết đang mở rộng AI ngôn ngữ từ dịch văn bản sang hiểu âm thanh, cảm xúc và cách trộn ngôn ngữ trong hội thoại, đồng thời đưa dịch thuật đến thiết bị và các ngôn ngữ ít dữ liệu.
Trong công bố ngày 15/9, Google cho biết công nghệ và sản phẩm của hãng hiện hỗ trợ giao tiếp hằng ngày bằng hơn 300 ngôn ngữ, phục vụ hơn 7 tỷ người, tương đương 86% dân số toàn cầu. Google Translate cũng đã tăng từ một số ít ngôn ngữ khi ra mắt năm 2006 lên hơn 250 ngôn ngữ.
Điểm nhấn mới trong định hướng này là chuyển từ dịch chữ sang xử lý ngôn ngữ như cách con người giao tiếp thực tế. Theo Google, các hệ thống AI cần nhận biết cả giọng điệu, nhịp nói, cảm xúc, tiếng lóng và hiện tượng chuyển đổi giữa nhiều ngôn ngữ trong cùng một câu, thay vì chỉ biến lời nói thành văn bản rồi mới dịch.
Dịch nói trực tiếp thay cho quy trình nhiều bước
Các hệ thống nhận dạng giọng nói truyền thống thường đi qua ba bước: chuyển âm thanh thành văn bản, xử lý văn bản, rồi tổng hợp lại thành giọng nói. Google cho rằng quy trình này dễ làm mất các tín hiệu quan trọng như nhịp điệu, cảm xúc và ngữ cảnh.
Hãng nói đang dùng những mô hình như Gemini để xử lý âm thanh trực tiếp; cùng họ công nghệ này cũng xuất hiện trong các công cụ nghiên cứu dựa trên tài liệu như NotebookLM. Gemini 3.5 Live Translate được giới thiệu là hỗ trợ dịch nói thời gian thực trên 70 ngôn ngữ và hơn 2.000 cặp ngôn ngữ, bao gồm khả năng xử lý code-switching, tức người nói chuyển qua lại giữa các ngôn ngữ trong lúc trò chuyện.
Gemini 3.5 Transcribe là mô hình chuyển giọng nói thành văn bản mà Google mô tả là chính xác nhất của hãng hiện nay. Mô hình này được thiết kế để làm việc với âm thanh nhiễu và thuật ngữ phức tạp. Google cho biết nó cũng hỗ trợ Rambler trên bàn phím Gboard, với các tính năng bỏ từ đệm, sửa ngữ pháp và dấu câu, hoặc chỉnh sửa câu bằng lệnh giọng nói.
Mục tiêu 1.000 ngôn ngữ và bài toán dữ liệu
Google đặt mục tiêu hỗ trợ 1.000 ngôn ngữ được sử dụng nhiều nhất trên thế giới. Trọng tâm kỹ thuật là Universal Speech Model, được huấn luyện bằng 12 triệu giờ âm thanh và dùng chuyển giao xuyên ngôn ngữ: mô hình áp dụng các mẫu học được từ ngôn ngữ có nhiều dữ liệu để cải thiện khả năng hiểu những ngôn ngữ có ít dữ liệu huấn luyện hơn.
Tuy nhiên, dữ liệu trên web vốn tập trung không tương xứng vào một số ngôn ngữ lớn. Google vì vậy nêu các hợp tác thu thập dữ liệu với cộng đồng địa phương. WAXAL là bộ dữ liệu giọng nói mở cho 27 ngôn ngữ tại châu Phi cận Sahara, được nói bởi hơn 100 triệu người ở trên 26 quốc gia.
Tại Ấn Độ, Project Vaani đã thu thập hơn 30.000 giờ giọng nói ở 109 ngôn ngữ từ hơn 155.000 người nói, theo Google. Amplify Initiative quy tụ hơn 1.600 chuyên gia địa phương cùng 20 đại học ở bốn châu lục để đóng góp 15.000 điểm dữ liệu đa phương thức. Hãng cũng giới thiệu Language Explorer, công cụ trực quan hóa kho dữ liệu mở LinguaMeta với hơn 7.000 ngôn ngữ nói, viết và ký hiệu.
Đưa AI đến nơi thiếu kết nối và thiết bị mạnh
Google cho biết hơn 3 tỷ người vẫn không có kết nối internet ổn định, nên dịch thuật phụ thuộc hoàn toàn vào đám mây không phù hợp với mọi nơi. TranslateGemma là họ mô hình dịch thuật nhẹ, mã nguồn mở, xây dựng từ Gemini và được huấn luyện trên 55 ngôn ngữ để có thể chạy hiệu quả ngay trên thiết bị.
Cách tiếp cận này giảm nhu cầu kết nối mạng liên tục, nhưng mô hình AI vẫn đòi hỏi phần cứng nhất định. Với người dùng điện thoại phổ thông, Google đang hỗ trợ Viamo vận hành trợ lý giọng nói Ask Viamo Anything (AVA). Dịch vụ này đã được thử nghiệm tại Rwanda và, theo Google, đã dùng Gemini để trả lời hơn 2 triệu câu hỏi.
Khả năng tiếp cận và ngữ cảnh văn hóa
Google cũng đưa ngôn ngữ ký hiệu và cách phát âm bản địa vào phạm vi phát triển sản phẩm. Sign Language-to-Text được huấn luyện trên hơn 50 ngôn ngữ ký hiệu, hỗ trợ nhập liệu ký hiệu thành văn bản trong Gboard và Live Transcribe trên Pixel 11, trước mắt từ Ngôn ngữ ký hiệu Mỹ sang tiếng Anh.
Tại New Zealand, Google cho biết đã làm việc với các chuyên gia tiếng Māori để cải thiện cách đọc tên địa danh trong Google Maps. Đây là ví dụ cho thấy chất lượng công nghệ ngôn ngữ không chỉ nằm ở việc dịch đúng nghĩa từ, mà còn ở khả năng phản ánh cách cộng đồng thực sự nói và gọi tên thế giới xung quanh.
Vì sao đáng chú ý?
Cuộc đua AI ngôn ngữ đang chuyển từ việc bổ sung thêm ngôn ngữ sang cải thiện chiều sâu hiểu biết trong bối cảnh giao tiếp thực. Nếu các mô hình xử lý tốt âm thanh, chuyển đổi ngôn ngữ và biến thể địa phương, chúng có thể hữu ích hơn trong giáo dục, chăm sóc sức khỏe, dịch vụ công và công việc hằng ngày tại các cộng đồng lâu nay ít được công nghệ hỗ trợ.
Dù vậy, các khả năng được nêu là công bố của Google; hiệu quả thực tế sẽ còn phụ thuộc vào từng ngôn ngữ, chất lượng dữ liệu, thiết bị người dùng và mức độ triển khai trong các sản phẩm cụ thể.
- Nguồn chính thức: AI for everyone in every language — Google AI — 15/09/2026

