Moonshot AI đã phát hành mô hình AI mã nguồn mở lớn nhất hiện nay Kimi K3 - ForkLog

AI-agents ИИ агенты 3# Moonshot AI ra mắt mô hình AI mở lớn nhất Kimi K3

Khởi nghiệp AI Trung Quốc Moonshot AI đã giới thiệu Kimi K3 — mô hình mở đầu tiên thuộc phân khúc 3T trên thế giới với 2,8 nghìn tỷ tham số, tầm nhìn gốc và ngữ cảnh 1 triệu token. Theo đánh giá của chính dự án, xét tổng thể, nó chỉ thua hai mô hình độc quyền là Claude Fable 5 và GPT 5.6 Sol.

Kimi K3 được xây dựng trên kiến trúc mới Kimi Delta Attention (KDA) và Attention Residuals (AttnRes). KDA giúp xử lý hiệu quả các chuỗi dữ liệu dài hơn, còn AttnRes trích xuất thông tin cần thiết không đồng đều trên mọi lớp mà theo cách chọn lọc. Nhờ đó, mô hình hiểu bối cảnh sâu hơn và vẫn giữ được ý nghĩa khi xử lý các văn bản phức tạp.

Độ thưa do framework Stable LatentMoE đảm nhiệm: trong số 896 chuyên gia, chỉ có 16 chuyên gia làm việc đồng thời. Kết hợp điều này với dữ liệu mới và thiết lập huấn luyện đã đem lại mức tăng hiệu quả gấp 2,5 lần so với K2.

Theo các nhà phát triển, chín trong số 12 tháng gần đây, các mô hình Kimi duy trì kỷ lục về quy mô trong nhóm các mô hình mở.

Nguồn: blog Kimi. Mô hình mới của Moonshot AI hiện đã có trên website, tại Kimi Work, Code và API. Theo mặc định, chế độ suy nghĩ tối đa được bật; các chế độ khác sẽ ra mắt sau. Trọng số đầy đủ và báo cáo sẽ được công bố vào ngày 27 tháng 7.

Kết quả trên các benchmark

Ở một số bài kiểm tra, K3 đạt kết quả cao hơn Fable 5 và GPT-5.6 Sol, nhưng ở các bài khác lại tụt rõ rệt. Nó dẫn đầu ở SWE Marathon (42 so với 35 và 39), BrowseComp (91,2 so với 88 và 90,4) và Program Bench (77,8 so với 76,8 và 77,6). Trên Terminal Bench 2.1, điểm của K3 là 88,3: cao hơn Fable 5 (84,6) và chỉ thấp hơn Sol 0,5 điểm (88,8).

Trong khi đó, ở FrontierSWE, K3 đạt 81,2 so với 86,6 của Fable 5, còn ở HLE-Full là 43,5 so với 53,3. Phương pháp thử nghiệm cũng khác nhau: một phần mô hình được chấm qua Claude Code, phần còn lại qua Codex hoặc KimiCode riêng.

Lập trình và tác vụ dạng tác nhân

K3 có thể thực hiện các phiên kỹ thuật dài mà gần như không cần sự tham gia của con người, định hướng trong các kho mã lớn và điều phối các công cụ dòng lệnh (terminal).

Trong bài thử tối ưu hóa lõi GPU của mô hình, các lõi chạy độc lập với nhau trong tối đa 24 giờ cho bốn tác vụ — bao gồm lõi AttnRes, KDA và MLA với kích thước đầu (head) 512 — trên NVIDIA H200 và GPU của một nhà sản xuất khác. K3 cho kết quả ngang Fable 5 và vượt đáng kể so với Opus 4.8, GPT-5.6 Sol và GPT-5.5. Ở các giai đoạn sau của quá trình phát triển, phiên bản sớm của K3 đã tự mình hoàn thành phần lớn công việc tối ưu hóa kiểu này bên trong đội ngũ Moonshot.

Nguồn: blog Kimi. Riêng mô hình tự viết từ đầu MiniTriton — bộ biên dịch gọn nhẹ cho các lõi GPU với lớp IR riêng trên MLIR và tạo mã PTX.

Thiết kế chip và phát triển game

Trong vai trò một màn trình diễn, K3 đã tự thiết kế một con chip cho mạng nơ-ron trên kiến trúc riêng.

Quá trình chạy độc lập mất 48 giờ: mô hình sử dụng các công cụ EDA mã nguồn mở và thư viện Nangate 45 nm. Con chip nằm gọn trong 4 mm², giữ được tần số 100 MHz và cho ra hơn 8700 token mỗi giây trong mô phỏng. Chip bao gồm 1,46 triệu ô tiêu chuẩn, 0,277 MB SRAM và mảng INT4 MAC có nhúng giải lượng tử hóa (dequantization) sẵn.

K3 cũng kết hợp suy luận 3D, mã và tầm nhìn để tạo các nguyên mẫu game và tương tác từ khái niệm, hình ảnh và video.

Làm việc với tri thức và video

Trong một trường hợp, K3 đã tái hiện các quan hệ phổ quát I-Love-Q từ thiên văn vật lý tính toán. Mất khoảng hai giờ thay vì một đến hai tuần làm việc của một nhà nghiên cứu giàu kinh nghiệm. Mô hình đã kiểm chứng hơn 20 bài báo khoa học, đánh giá hơn 300 phương trình trạng thái, phát hiện các điểm không nhất quán trong các công thức đã công bố và viết hơn 3000 dòng mã Python, đồng thời đóng gói kết quả thành một bảng điều khiển HTML tương tác.

Ở một trường hợp khác, K3 chuẩn bị một báo cáo tương tác về 42 năm lịch sử của ngành công nghiệp chip ASIC thông qua 120 vòng tự cải thiện đệ quy, xử lý hơn 11 000 trang từ 87 báo cáo quý và 99 PDF gốc.

Nguồn: blog Kimi. Nhờ làm việc “native” với video, K3 có thể dựng video: trong một ví dụ, mô hình tạo hoạt ảnh giải thích kiến trúc của riêng mình theo phong cách 3Blue1Brown; ở ví dụ khác, mô hình tự dựng trailer về màn ra mắt của mình từ 56 clip gốc, bao gồm chọn khung hình, đồng bộ với nhạc và xử lý âm thanh. Theo đánh giá của Moonshot, công việc này sẽ mất 1–2 ngày với một biên tập viên giàu kinh nghiệm và 3–5 ngày với người mới.

Hạn chế

Nhóm dự án nhấn mạnh rằng K3 nhạy cảm với việc mất lịch sử suy nghĩ khi chuyển môi trường tác nhân giữa chừng trong một phiên; mô hình cũng có thể thể hiện mức độ chủ động quá mức trong các tình huống mơ hồ. Về mức độ dễ sử dụng, hiện tại mô hình vẫn kém rõ rệt so với Fable 5 và GPT-5.6 Sol.

Nhắc lại, vào tháng 7 năm 2025, Moonshot AI đã phát hành Kimi K2 — mô hình đầu tiên trong dòng sản phẩm với 1 nghìn tỷ tham số, nhanh chóng trở thành một trong những hệ thống mở hàng đầu cho các tác vụ dạng tác nhân.

NVDA1,01%
Xem bản gốc
Trang này có thể chứa nội dung của bên thứ ba, được cung cấp chỉ nhằm mục đích thông tin (không phải là tuyên bố/bảo đảm) và không được coi là sự chứng thực cho quan điểm của Gate hoặc là lời khuyên về tài chính hoặc chuyên môn. Xem Tuyên bố từ chối trách nhiệm để biết chi tiết.
  • Phần thưởng
  • Bình luận
  • Đăng lại
  • Retweed
Bình luận
Thêm một bình luận
Thêm một bình luận
Không có bình luận
  • Đã ghim