Công cụ AI

Kimi K3 Là Gì? Có Nên Dùng Thay Claude Hay GPT Không?

Kimi K3 Là Gì? Có Nên Dùng Thay Claude Hay GPT Không?

Ngày 16/07/2026, Moonshot AI ra mắt Kimi K3, mô hình mã nguồn mở có tổng cộng 2,8 nghìn tỷ tham số, trở thành mô hình mở lớn nhất từng được công bố tính đến thời điểm này. Điểm đáng chú ý không nằm ở số tham số khổng lồ, mà ở cách Moonshot chuyển phần lớn áp lực từ tính toán sang bộ nhớ, nhờ kiến trúc Mixture-of-Experts và các kỹ thuật nén mô hình. Bài viết này giải thích Kimi K3 là gì, kiến trúc hoạt động ra sao, năng lực thực tế và những giới hạn doanh nghiệp cần biết trước khi sử dụng.

Kimi K3 Là Gì?

Kimi K3 là mô hình ngôn ngữ lớn mã nguồn mở do Moonshot AI phát triển, ra mắt ngày 16/07/2026, với tổng cộng 2,8 nghìn tỷ tham số, hiện là mô hình mã nguồn mở lớn nhất từng được công bố. Mô hình dùng kiến trúc Mixture-of-Experts, hỗ trợ cửa sổ ngữ cảnh lên đến một triệu token.

Moonshot định vị mạnh nhất ở hai nhóm năng lực: coding agent chạy dài với mức giám sát tối thiểu, và các quy trình nghiên cứu, tổng hợp tri thức từ đầu đến cuối. K3 hiện có trên Kimi.com, ứng dụng Kimi, Kimi Work, Kimi Code và Kimi API, đồng thời sẽ phát hành đầy đủ trọng số mô hình trước hoặc vào ngày 27/07/2026.

Với người ra quyết định, 3 điều cần nắm ngay:

  • K3 không phải mô hình "mạnh nhất tuyệt đối", ngay Moonshot cũng thừa nhận trải nghiệm tổng thể vẫn kém Claude Fable 5 và GPT-5.6 Sol
  • Việc tự triển khai đòi hỏi hạ tầng cấp trung tâm dữ liệu (tối thiểu 64 GPU)
  • Giá trị thực sự nằm ở việc mở rộng thêm một lựa chọn mã nguồn mở đáng tin cậy, không phải một cuộc cách mạng thay thế toàn bộ ngăn xếp AI hiện có.

Vì Sao 2,8 Nghìn Tỷ Tham Số Của Kimi K3 Đáng Chú Ý?

Tham số là những giá trị mô hình học được trong quá trình huấn luyện. Số lượng tham số thể hiện quy mô, nhưng không đồng nghĩa mô hình lớn hơn thì thông minh hơn.

Nếu toàn bộ 2,8 nghìn tỷ tham số cùng hoạt động mỗi bước, K3 sẽ cần tài nguyên tính toán rất lớn. Vì vậy Moonshot dùng kiến trúc Mixture-of-Experts (MoE), chia mô hình thành 896 "chuyên gia" nhưng chỉ kích hoạt 16 “chuyên gia” phù hợp tại một thời điểm. Có thể hình dung như một tổ chức lớn với hàng trăm nhân sự chuyên môn khác nhau: khi có nhiệm vụ, hệ thống chỉ gọi đúng nhóm chuyên gia cần thiết thay vì huy động toàn bộ.

Kimi K3 còn có hai thay đổi kiến trúc chính:

  • Kimi Delta Attention: xử lý hiệu quả hơn khi lượng nội dung đầu vào tăng.
  • Attention Residuals: giúp mô hình chọn lọc thông tin từ các lớp trước, thay vì tích lũy toàn bộ.

Mô hình cũng dùng Stable LatentMoE để định tuyến giữa 896 chuyên gia. Theo Moonshot, khi kết hợp các thay đổi về kiến trúc, dữ liệu và quy trình huấn luyện, K3 đạt hiệu quả mở rộng cao hơn khoảng 2,5 lần so với Kimi K2 (số liệu do Moonshot công bố).

Cửa Sổ Ngữ Cảnh Một Triệu Token Của Kimi K3 Dùng Để Làm Gì?

Kimi K3 tiếp nhận tối đa một triệu token trong cùng một ngữ cảnh, cho phép xử lý khối lượng tài liệu hoặc mã nguồn lớn mà không cần chia nhỏ cuộc trò chuyện. Khả năng này phù hợp với:

  • Đọc kho mã nguồn lớn
  • Tổng hợp nhiều tài liệu nghiên cứu
  • Phân tích báo cáo dài
  • Theo dõi nhiệm vụ nhiều bước liên tiếp

Moonshot sử dụng định dạng MXFP4 cho trọng số và MXFP8 cho giá trị kích hoạt trong quá trình huấn luyện có nhận biết lượng tử hóa. Nói đơn giản, cách làm này giúp giảm lượng bộ nhớ cần dùng và cho phép Kimi K3 hoạt động trên nhiều loại phần cứng hơn.

Moonshot cũng phát triển một cơ chế lưu lại phần dữ liệu mà mô hình đã xử lý trước đó dành cho Kimi Delta Attention, sau đó đóng góp phần triển khai này cho cộng đồng vLLM. Nhờ vậy, khi gặp lại nội dung tương tự, hệ thống có thể tận dụng dữ liệu đã có thay vì xử lý lại hoàn toàn từ đầu.

Tuy nhiên, Kimi K3 vẫn là một mô hình rất lớn. Moonshot khuyến nghị triển khai mô hình trên một cụm gồm ít nhất 64 bộ tăng tốc AI được kết nối với nhau bằng đường truyền tốc độ cao. Điều này có nghĩa K3 phù hợp với hạ tầng trung tâm dữ liệu hơn là một máy chủ thông thường.

Kimi K3 Mạnh Nhất Ở Năng Lực Nào?

Moonshot định vị coding là năng lực trọng tâm của Kimi K3. Mô hình có thể duy trì phiên kỹ thuật kéo dài, điều hướng kho mã nguồn lớn, dùng nhiều công cụ terminal và làm việc với mức giám sát hạn chế. Nhờ khả năng thị giác, K3 còn quan sát ảnh chụp màn hình, kiểm tra sản phẩm đang chạy rồi tiếp tục sửa mã, quy trình Moonshot gọi là "vision in the loop".

Tối ưu GPU kernel: Trong thử nghiệm tối ưu Attention Residuals, K3 chạy liên tục 15 giờ, thiết kế thuật toán kernel hai giai đoạn, hợp nhất nhiều kernel mà vẫn giữ kết quả số học, giảm thời gian forward và backward từ 283,6 xuống 114,4 mili giây. Moonshot cho biết K3 đạt kết quả tương đương Claude Fable 5 trong trường hợp này, nhưng lưu ý Claude Fable 5 được bên thứ ba đánh giá và có thể gồm cơ chế fallback, nên đây không phải phép so sánh hoàn toàn đồng nhất.

Tự xây trình biên dịch GPU: K3 xây dựng MiniTriton, trình biên dịch có cấu trúc tương tự Triton gồm lớp biểu diễn trung gian dựa trên MLIR, các bước tối ưu mã, đường ống tạo mã PTX và runtime thực thi. Theo bài đo của Moonshot, MiniTriton đạt hiệu năng ngang bằng hoặc cao hơn Triton và torch.compile trong một số workload, và có thể chạy huấn luyện nanoGPT từ đầu đến cuối với đường loss bám sát kết quả tham chiếu.

Phát triển game 3D: K3 xây dựng một game khám phá thế giới mở 3D chạy trên trình duyệt bằng Three.js WebGPU, gồm rừng cây, làng nhà gỗ, núi tuyết, thời tiết thay đổi và nhân vật cưỡi ngựa. Moonshot lưu ý dự án vẫn dùng một số tài sản bên ngoài như hoạt ảnh cao bồi, ngựa và dữ liệu địa hình.

Thiết kế chip trong mô phỏng: Trong thử nghiệm 48 giờ, K3 thiết kế một chip phục vụ mô hình nhỏ dựa trên kiến trúc của chính nó, dùng công cụ EDA mã nguồn mở và thư viện Nangate 45nm. Kết quả mô phỏng: diện tích dưới 4 mm², tần số 100 MHz, tốc độ giải mã hơn 8.700 token/giây, 1,46 triệu standard cell, 0,277 MB SRAM. Đây là kết quả mô phỏng nội bộ, chưa phải chip vật lý đã sản xuất.

Nghiên cứu khoa học: Với bài toán tái tạo mối quan hệ I–Love–Q trong vật lý thiên văn, K3 đọc và đối chiếu hơn 20 bài nghiên cứu, đánh giá hơn 300 phương trình trạng thái, phát hiện điểm không nhất quán trong một số công thức đã công bố, tạo hơn 3.000 dòng mã Python và dashboard HTML tương tác, trong khoảng hai giờ. Moonshot ước tính một nhà nghiên cứu có kinh nghiệm cần một đến hai tuần cho công việc tương tự (ước tính của công ty, chưa phải đo lường độc lập).

Kimi K3 Làm Được Những Công Việc Nào Ngoài Coding?

Ngoài lập trình, K3 có thể tìm kiếm, đọc nhiều nguồn, phân tích dữ liệu, tạo biểu đồ và trình bày kết quả trong giao diện tương tác. Moonshot đưa ra ba ví dụ:

  1. Website nghiên cứu về 42 năm ngành AI ASIC: hơn 120 vòng tự cải thiện, hơn 2.800 lượt tìm kiếm/truy xuất web, hơn 1.100 lượt lấy dữ liệu qua terminal, hơn 11.000 trang tài liệu, 87 báo cáo tài chính theo quý, 99 tài liệu PDF gốc.
  2. Báo cáo phong cách tư vấn về năng lượng nhiệt hạch: gồm dòng thời gian, Funnel Chart, Range Bar Chart, Gantt Chart và slide trình bày.
  3. Phân tích 391 sự kiện sóng hấp dẫn: điều phối hơn 20 tác nhân phụ đồng thời, tạo 7 hình ảnh trực quan khoa học, 2 bảng dữ liệu, tổng hợp tài liệu từ hơn 10 bài nghiên cứu.

Các trường hợp trên đều do Moonshot công bố, hiệu quả trong dự án độc lập vẫn cần kiểm chứng thêm.

Kimi K3 Tích Hợp Vào Kimi Work Như Thế Nào?

K3 được đưa vào Kimi Work qua hai tính năng chính:

  • Widgets và Dashboard: widget có thể kết nối dữ liệu trên máy hoặc plugin ngoài để tự cập nhật; dashboard tập hợp các widget quan trọng theo dự án, chủ đề hoặc mục tiêu.
  • Chỉnh sửa video: kiến trúc đa phương thức xử lý văn bản, hình ảnh, video trong cùng mô hình. K3 từng tạo video motion graphics phong cách 3Blue1Brown và chỉnh sửa video giới thiệu từ 56 đoạn phim nguồn gồm chọn cảnh, cắt theo chuyển động, đồng bộ nhịp, xử lý âm thanh qua nhiều vòng. Moonshot ước tính công việc tương đương cần một đến hai ngày với editor có kinh nghiệm, hoặc ba đến năm ngày với người mới.

Kimi K3 Đạt Điểm Benchmark Bao Nhiêu So Với Claude Fable 5 Và GPT-5.6 Sol?

Benchmark

Kimi K3

Claude Fable 5

GPT-5.6 Sol

Terminal Bench 2.1

88,3

84,6

88,8

BrowseComp

91,2

88,0

90,4

GPQA-Diamond

93,5

92,6

94,1

MathVision

94,3

94,8

95,8

OmniDocBench

91,1

 

K3 vượt trội ở một số bài đánh giá cụ thể như BrowseComp và GPQA-Diamond, nhưng không dẫn đầu toàn bộ bảng. Moonshot thừa nhận hiệu năng tổng thể và trải nghiệm sử dụng của K3 vẫn còn khoảng cách so với Claude Fable 5 và GPT-5.6 Sol. Kết quả cần đọc thận trọng vì một số bài là benchmark nội bộ, các mô hình dùng hệ thống vận hành khác nhau (Kimi Code, Claude Code, Codex), và Claude Fable 5 gặp fallback trong 35% nhiệm vụ ở thử nghiệm SWE Marathon do Moonshot thực hiện.

Cách Sử Dụng Kimi K3 Và Mức Giá

Kimi K3 hiện có trên:

  • Kimi.com và ứng dụng Kimi (iOS, Android, HarmonyOS)
  • Kimi Work bản 3.1.0 trở lên (Windows, Mac Apple silicon)
  • Kimi Code trong terminal
  • Kimi API với tên mô hình kimi-k3
  • Kimi Enterprise cho tổ chức

Giá API do Moonshot công bố: 0,30 USD/triệu token đầu vào nếu trúng cache, 3 USD/triệu token đầu vào nếu không trúng cache, 15 USD/triệu token đầu ra. Moonshot cho biết API chính thức đạt tỷ lệ cache hit trên 90% trong workload coding, dù chi phí thực tế vẫn phụ thuộc nội dung đầu vào và độ dài đầu ra. 

Tại thời điểm ra mắt, K3 mặc định dùng mức suy luận tối đa; các chế độ thấp và cao sẽ được bổ sung sau. Moonshot dự kiến phát hành toàn bộ trọng số trước hoặc vào ngày 27/07/2026, nhưng chưa xác nhận công khai mã nguồn, dữ liệu hay quy trình huấn luyện.

Doanh Nghiệp Có Thể Tự Triển Khai Kimi K3 Không?

Việc phát hành trọng số cho phép tổ chức có hạ tầng phù hợp tải xuống và triển khai mô hình. Tuy nhiên Moonshot khuyến nghị cấu hình từ 64 bộ tăng tốc trở lên, mức yêu cầu ở quy mô trung tâm dữ liệu chứ không phải máy chủ doanh nghiệp thông thường. Doanh nghiệp cần phân biệt rõ hai vấn đề: có quyền truy cập trọng số mô hình, và có đủ hạ tầng/phần mềm để vận hành hiệu quả. Moonshot cho biết đang phối hợp với các đối tác suy luận và đội ngũ phần mềm mã nguồn mở để thống nhất kỹ thuật trước khi phát hành rộng rãi.

Kimi K3 Có Những Hạn Chế Nào?

Moonshot nêu ba hạn chế chính:

  1. Nhạy cảm với lịch sử suy luận: nếu hệ thống Agent không truyền đầy đủ lịch sử, hoặc người dùng chuyển sang K3 giữa phiên đang chạy bằng mô hình khác, chất lượng đầu ra có thể thiếu ổn định. Moonshot khuyến nghị dùng harness đã kiểm tra tương thích như Kimi Code.
  2. Chủ động quá mức: K3 được huấn luyện cho nhiệm vụ dài hạn, độ khó cao, nên khi gặp vấn đề nhỏ hoặc yêu cầu chưa rõ, mô hình có thể tự quyết định thay người dùng. Với ứng dụng cần giới hạn hành vi chặt chẽ, nên bổ sung quy tắc cụ thể trong system prompt hoặc tệp AGENTS.md.
  3. Khoảng cách trải nghiệm: dù có khả năng cạnh tranh, K3 vẫn có khoảng cách đáng chú ý về trải nghiệm sử dụng so với Claude Fable 5 và GPT-5.6 Sol.

Câu Hỏi Thường Gặp Về Kimi K3

Kimi K3 là gì? Mô hình mã nguồn mở của Moonshot AI, ra mắt 07/2026, 2,8 nghìn tỷ tham số, toàn bộ trọng số công khai.

Kimi K3 có bao nhiêu tham số? 2,8 nghìn tỷ tham số, nhưng chỉ 16 trong 896 "chuyên gia" hoạt động mỗi token. Nhờ vậy mô hình lớn mà vẫn vận hành được với chi phí hợp lý.

Kimi K3 có hỗ trợ đa phương thức không? Có. K3 hiểu hình ảnh gốc, dùng ảnh chụp màn hình để tự debug code, đặt ngang hàng GPT-5.6 Sol và Claude Fable 5 ở nhóm ít mô hình mở làm được điều này.

Kimi K3 có mạnh hơn Claude Fable 5 và GPT-5.6 Sol không? Không hẳn. K3 xếp thứ ba trên Artificial Analysis Intelligence Index (57 điểm, sau Fable 5 60 điểm và GPT-5.5 Sol 59 điểm), nhưng thắng Fable 5 ở Terminal-Bench, SWE Marathon, và dẫn đầu Frontend Code Arena. Moonshot cũng thừa nhận còn khoảng cách về trải nghiệm và khả năng làm theo hướng dẫn so với hai mô hình kia.

Điểm benchmark cao có đồng nghĩa mô hình đáng tin hơn không? Không hẳn. K3 sai 51% trong các câu trả lời không đúng trên chỉ số hallucination AA-Omniscience, so với 54,9% của Fable 5, nhưng cách tính này có thể đánh lừa: mô hình càng ít từ chối trả lời càng dễ có tỷ lệ này cao hơn dù không hẳn kém tin cậy hơn. Nhiều benchmark cũng đã bão hòa, chênh vài điểm giữa các mô hình đầu bảng có thể chỉ là nhiễu đo lường.

Giá dùng Kimi K3 qua API bao nhiêu? 0,30 USD/triệu token đầu vào nếu trúng cache, 3 USD nếu không trúng cache, 15 USD/triệu token đầu ra.

Doanh nghiệp nhỏ có tự chạy được Kimi K3 không? Rất khó. Cần tối thiểu 64 GPU nối băng thông cao, tương đương hạ tầng trung tâm dữ liệu. Đa số nên dùng qua API hoặc app có sẵn thay vì tự host.

Kết Luận

Kimi K3 đánh dấu lần đầu một mô hình mở trọng số đạt quy mô 2,8 nghìn tỷ tham số, nhưng số lượng tham số không phải điều quan trọng nhất. Các kết quả về coding, nghiên cứu khoa học và công việc tri thức phần lớn do Moonshot công bố, nên hiệu quả thực tế cần được kiểm chứng thêm khi trọng số và hệ sinh thái phần mềm được phát hành đầy đủ. Dù chưa chứng minh vượt qua các hệ thống độc quyền hàng đầu, Kimi K3 cho thấy các mô hình mã nguồn mở đang mở rộng năng lực từ trả lời câu hỏi sang những nhiệm vụ dài, nhiều bước và gắn chặt với quy trình làm việc thực tế. Nếu doanh nghiệp bạn đang cân nhắc mô hình AI phù hợp cho công việc, hãy tìm hiểu thêm các bài phân tích công cụ AI khác của Skills Bridge để đưa ra lựa chọn đúng đắn.

Reading next

Google Ra Mắt Gemini 3.6 Flash, 3.5 Flash-Lite Và 3.5 Flash Cyber
Anthropic Hướng Dẫn Cách Viết Prompt Hiệu Quả Cho Claude!