Kimi K3 Ra Mắt: Mô Hình Open-Weight 2,8 Nghìn Tỷ Tham Số Đang Thay Đổi Cuộc Đua AI
Moonshot AI ra mắt Kimi K3 với 2,8 nghìn tỷ tham số, vision gốc, ngữ cảnh một triệu token và năng lực agent dài hạn. Bài viết phân tích hiệu năng, giá API, giới hạn triển khai và tác động với AI Creator, doanh nghiệp.

1:04 ước tính · Chưa có giọng vi-VN
Kimi K3 ra mắt: Mô hình open-weight 2,8 nghìn tỷ tham số đang thay đổi cuộc đua AI
Một mô hình AI mới từ Trung Quốc đang buộc thị trường phải nhìn lại giả định rằng năng lực frontier chỉ thuộc về vài phòng thí nghiệm Mỹ. Kimi K3 của Moonshot AI có quy mô 2,8 nghìn tỷ tham số, hỗ trợ hình ảnh ngay từ kiến trúc gốc, cửa sổ ngữ cảnh một triệu token và được thiết kế cho lập trình dài hạn, nghiên cứu, xử lý tri thức cùng các quy trình AI tác nhân.
Điểm đáng chú ý không chỉ nằm ở con số tham số. Kimi K3 xuất hiện trong bối cảnh doanh nghiệp ngày càng quan tâm đến những mô hình có thể tùy chỉnh, kiểm soát dữ liệu tốt hơn và giảm chi phí cho các tác vụ khối lượng lớn. Sự kiện này vì thế không đơn thuần là một cuộc đua benchmark, mà là tín hiệu cho thấy thị trường AI có thể tách thành hai lớp: mô hình frontier đóng dành cho công việc khó nhất và mô hình open-weight đủ mạnh để xử lý phần lớn quy trình vận hành thường ngày.
Kimi K3 là gì?
Theo công bố chính thức của Moonshot AI, Kimi K3 là model mạnh nhất của hãng tính đến tháng 7/2026. Mô hình có 2,8 nghìn tỷ tham số, khả năng hiểu hình ảnh gốc và cửa sổ ngữ cảnh một triệu token. Moonshot định vị K3 cho ba nhóm công việc chính: lập trình dài hạn, xử lý tri thức chuyên sâu và suy luận nhiều bước.
Kimi K3 hiện đã được đưa vào Kimi.com, Kimi Work, Kimi Code và Kimi API. Hệ thống agent của Kimi có thể phối hợp hơn 20 công cụ để xây website, tạo tài liệu, phân tích dữ liệu và hoàn thành những đầu việc kéo dài qua nhiều bước. Tài liệu sản phẩm của hãng cũng cho biết K3 hỗ trợ Agent Swarm, cho phép nhiều tác nhân hoạt động song song trong cùng một quy trình.

Tuy nhiên, cần phân biệt rõ giữa công bố “open” và tình trạng phát hành thực tế. Moonshot cho biết toàn bộ trọng số Kimi K3 sẽ được phát hành vào ngày 27/7/2026. Tính đến ngày 19/7/2026, người dùng có thể sử dụng model qua các sản phẩm và API của Kimi, nhưng chưa nên hiểu rằng toàn bộ trọng số đã sẵn sàng để tải xuống và tự triển khai.
Vì sao quy mô 2,8 nghìn tỷ tham số chưa nói lên toàn bộ câu chuyện?
Số lượng tham số thường được dùng để mô tả quy mô của một mô hình, nhưng model lớn hơn không tự động đồng nghĩa với chất lượng tốt hơn trong mọi tác vụ. Điều quan trọng hơn là số tham số được kích hoạt khi suy luận, kiến trúc attention, cách định tuyến chuyên gia, dữ liệu huấn luyện và khả năng biến compute thành kết quả hữu ích.
Kimi K3 sử dụng kiến trúc Mixture of Experts với 896 chuyên gia và kích hoạt hiệu quả 16 chuyên gia cho mỗi lượt xử lý. Model kết hợp Kimi Delta Attention, Attention Residuals và Stable LatentMoE. Theo Moonshot, các thay đổi này tạo ra mức cải thiện khoảng 2,5 lần về hiệu quả mở rộng so với Kimi K2.
Hãng cũng áp dụng MXFP4 cho trọng số và MXFP8 cho activation nhằm tăng khả năng tương thích phần cứng. Dù vậy, tài liệu kỹ thuật khuyến nghị cấu hình supernode từ 64 accelerator trở lên để triển khai hiệu quả. Điều này cho thấy “open-weight” không đồng nghĩa với việc người dùng phổ thông có thể chạy Kimi K3 trên laptop, máy tính cá nhân hoặc một GPU đơn lẻ.
Kimi K3 mạnh đến đâu so với GPT-5.6 và Claude?
Moonshot thừa nhận hiệu năng tổng thể của Kimi K3 vẫn đứng sau những model proprietary mạnh nhất như Claude Fable 5 và GPT-5.6 Sol. Đây là chi tiết quan trọng vì nó giúp tránh cách diễn giải rằng K3 đã vượt mọi đối thủ trong mọi nhóm tác vụ.
Dù vậy, model đã đạt kết quả mạnh trong một số đánh giá độc lập. Reuters cho biết Arena.ai xếp Kimi K3 đứng đầu trong một bài đánh giá xây dựng giao diện web, Vals AI đặt model ở vị trí thứ hai sau Fable 5, còn Artificial Analysis ghi nhận năng lực tương đương GPT-5.5 và Claude Opus 4.8 ở một số bài kiểm tra nhiều bước.
Các kết quả này cho thấy K3 đã bước vào nhóm model có thể cạnh tranh thực tế, nhưng benchmark vẫn cần được đọc cùng phương pháp đánh giá. Một model chạy bằng Kimi Code, Claude Code hoặc Codex có thể nhận được hệ thống công cụ, prompt và cơ chế điều phối khác nhau. Vì vậy, doanh nghiệp không nên chọn model chỉ từ một bảng xếp hạng mà cần thử trên chính dữ liệu, quy trình và tiêu chuẩn đầu ra của mình.
Để có thêm bối cảnh về cách các model frontier đang được định vị theo năng lực, chi phí và tác vụ, bạn có thể xem bài Grok 4.5 và GPT-5.6 thực sự đứng đâu khi so với Claude Opus? trên NextGZ.
Giá API Kimi K3 có tạo áp lực lên OpenAI và Anthropic?
Moonshot công bố giá Kimi API ở mức 0,30 USD cho một triệu token đầu vào khi cache hit, 3 USD khi cache miss và 15 USD cho một triệu token đầu ra. Hãng cho biết kiến trúc suy luận Mooncake có thể đạt tỷ lệ cache hit trên 90% trong workload lập trình, dù con số thực tế của từng ứng dụng sẽ phụ thuộc vào mức độ lặp lại của prompt và dữ liệu đầu vào.
Giá công bố này giúp Kimi K3 trở thành một lựa chọn đáng chú ý cho hệ thống cần xử lý lượng lớn mã nguồn, tài liệu hoặc tác vụ agent. Tuy nhiên, chi phí token chỉ là một phần của tổng chi phí sở hữu. Doanh nghiệp còn phải tính thời gian phản hồi, tỷ lệ hoàn thành thành công, số lần phải chạy lại, công sức kiểm tra của con người, chi phí lưu trữ, bảo mật và khả năng tích hợp vào hạ tầng hiện có.
Xu hướng rộng hơn đang tạo áp lực lên mô hình kinh doanh của các phòng thí nghiệm AI Mỹ. Axios nhận định các model open-weight giá thấp đang được sử dụng ngày càng nhiều cho lập trình thường ngày, tóm tắt, trích xuất dữ liệu và chăm sóc khách hàng, trong khi model cao cấp được dành cho số ít yêu cầu khó nhất.
Terminal Bench 2.1 scores (engineering tasks) | | |
|---|---|---|
| | |
| | |
| | |
Kimi K3 có ý nghĩa gì với AI Creator?
Nghiên cứu dài và xử lý nhiều tài liệu
Cửa sổ ngữ cảnh một triệu token cho phép Kimi K3 tiếp nhận codebase lớn, nhiều tài liệu nghiên cứu hoặc bộ dữ liệu văn bản dài trong một phiên xử lý. Với AI Creator, điều này có thể hỗ trợ quá trình tổng hợp nguồn, xây outline, đối chiếu thông tin, chuyển nghiên cứu thành bài blog, kịch bản video, slide và website tương tác.
Dù cửa sổ ngữ cảnh lớn, người dùng vẫn cần tổ chức dữ liệu đầu vào rõ ràng. Đưa một khối tài liệu rất dài vào model không bảo đảm mọi chi tiết đều được ưu tiên đúng. Workflow tốt nên có bước lập chỉ mục, chia nhóm nguồn, xác định câu hỏi nghiên cứu và yêu cầu model dẫn lại tài liệu cụ thể cho từng kết luận quan trọng.

Tạo website, dashboard và sản phẩm nội dung tương tác
K3 được thiết kế để kết hợp coding với khả năng nhìn ảnh chụp màn hình. Điều này phù hợp với những công việc cần model vừa viết code, vừa quan sát kết quả giao diện và tiếp tục chỉnh sửa. AI Creator có thể dùng hướng tiếp cận này để tạo landing page, dashboard dữ liệu, báo cáo tương tác hoặc nguyên mẫu sản phẩm mà không phải chuyển liên tục giữa nhiều công cụ.
Giá trị thật không nằm ở việc model tạo được một giao diện đẹp trong lần đầu, mà ở khả năng duy trì mục tiêu qua nhiều vòng: đọc brief, xây cấu trúc, viết code, chạy thử, quan sát lỗi, chỉnh sửa và đóng gói đầu ra.
Sản xuất nội dung quy mô lớn
Kimi K3 có thể phù hợp với quy trình cần tạo nhiều biến thể tiêu đề, mô tả sản phẩm, metadata, bản dịch hoặc nội dung theo mẫu. Tuy nhiên, người làm nội dung không nên giao toàn bộ quyền xuất bản cho agent. Những phần liên quan đến dữ kiện mới, giá cả, luật, sức khỏe, tài chính hoặc phát ngôn của cá nhân vẫn cần nguồn gốc rõ ràng và bước duyệt của con người.
Doanh nghiệp có nên chuyển sang Kimi K3 ngay?
Kimi K3 đáng để thử nghiệm, nhưng chưa có lý do hợp lý để chuyển toàn bộ hệ thống chỉ vì model có quy mô lớn hoặc giá API hấp dẫn. Một chương trình đánh giá tốt nên bắt đầu bằng một workflow có phạm vi rõ, chẳng hạn phân tích báo cáo, hỗ trợ lập trình, tạo tài liệu bán hàng hoặc xử lý phản hồi khách hàng.
Doanh nghiệp có thể so sánh Kimi K3 với model đang sử dụng dựa trên các chỉ số sau:
Tỷ lệ hoàn thành đúng toàn bộ nhiệm vụ thay vì chỉ trả lời đúng từng bước.
Chi phí trên mỗi kết quả được chấp nhận, bao gồm cả lượt chạy lại.
Thời gian con người phải sửa, kiểm tra và phê duyệt.
Độ ổn định khi xử lý cùng một loại yêu cầu nhiều lần.
Khả năng kiểm soát dữ liệu, phân quyền công cụ và lưu vết hành động.
Với agent có quyền thao tác hệ thống, nên triển khai trong sandbox, giới hạn quyền đọc ghi, tách môi trường thử nghiệm khỏi production, không cung cấp bí mật vượt quá phạm vi cần thiết và duy trì bản sao lưu. Model mạnh hơn có thể hoàn thành nhiều việc hơn, nhưng cũng tạo ra phạm vi ảnh hưởng lớn hơn nếu yêu cầu, quyền truy cập hoặc cơ chế phê duyệt được cấu hình không đúng.
Open-weight không đồng nghĩa với miễn phí hoặc dễ triển khai
Kimi K3 mở ra khả năng nghiên cứu, tùy chỉnh và triển khai riêng sau khi trọng số đầy đủ được phát hành. Tuy nhiên, model 2,8 nghìn tỷ tham số đòi hỏi hạ tầng rất lớn. Reuters dẫn nhận định rằng chi phí thiết bị để tự chạy model có thể lên đến hàng trăm nghìn USD, khiến phần lớn startup và doanh nghiệp nhỏ vẫn phải sử dụng API hoặc nhà cung cấp inference.
Do đó, lợi ích của open-weight đối với nhiều doanh nghiệp không nhất thiết là tự dựng cụm máy. Giá trị có thể nằm ở khả năng lựa chọn nhà cung cấp hạ tầng, fine-tune theo ngành, kiểm tra model độc lập, áp dụng chính sách dữ liệu riêng và tránh bị khóa hoàn toàn vào một API duy nhất.
Kimi K3 có thể thay đổi cuộc đua AI theo hướng nào?
Trong giai đoạn trước, cuộc đua AI thường được mô tả bằng model nào thông minh nhất. Kimi K3 cho thấy câu hỏi đang chuyển sang model nào tạo ra tỷ lệ năng lực trên chi phí tốt nhất, có thể kiểm soát đến đâu và tích hợp vào quy trình thật nhanh như thế nào.
Nếu một model open-weight có thể giải quyết phần lớn tác vụ lập trình, nghiên cứu và vận hành với chi phí thấp hơn, các model đóng sẽ phải chứng minh giá trị ở những yêu cầu khó nhất, mức độ an toàn, hệ sinh thái công cụ, độ ổn định và hỗ trợ doanh nghiệp. Ngược lại, Moonshot cũng phải chứng minh rằng kết quả benchmark có thể chuyển thành hiệu quả sản xuất ổn định, đặc biệt khi model được triển khai ngoài môi trường do hãng kiểm soát.
Điều cần theo dõi sau ngày 19/7/2026
Mốc quan trọng tiếp theo là ngày 27/7/2026, khi Moonshot dự kiến phát hành đầy đủ trọng số Kimi K3. Báo cáo kỹ thuật sắp tới cũng cần làm rõ thêm dữ liệu huấn luyện, hiệu quả suy luận, giới hạn an toàn, giấy phép sử dụng và kết quả khi cộng đồng triển khai trên nhiều hạ tầng khác nhau.
Kimi K3 chưa chứng minh rằng model open-weight đã thay thế hoàn toàn GPT-5.6, Claude hoặc các hệ thống proprietary khác. Nhưng nó đã chứng minh một điều đáng chú ý hơn: khoảng cách giữa model mở và model frontier đóng đang thu hẹp đủ nhanh để ảnh hưởng trực tiếp đến chiến lược sản phẩm, chi phí AI và cách doanh nghiệp lựa chọn hạ tầng trong năm 2026.
Đánh giá bài viết
More from author

NVIDIA công bố kiến trúc Rubin GPU: HBM4 22 TB/s thay đổi AI tác nhân ra sao?

Hướng dẫn tạo và quản lý Ruler trong Clip Studio Paint: Guide Line, Symmetry và dựng hình Manga

Krita dựng phối cảnh thực dụng cho background anime: đường chân trời, điểm tụ và kiểm tra sai lệch

OpenAI ra mắt chương trình ChatGPT cho doanh nghiệp nhỏ: Có gì đáng chú ý?
You might also like

10 plugin Codex biến AI viết code thành một nền tảng làm việc thực thụ

GPT-5.6 Chính Thức Ra Mắt: Sol, Terra, Luna Và Bước Chuyển Từ Chatbot Sang AI Làm Việc

Bình luận
0 bình luận
Đăng nhập để tham gia thảo luận cùng cộng đồng!
Đăng nhập ngayĐang tải bình luận...