Kimi K3 昨晚 ra mắt mã nguồn sau đó, hiệu suất dữ liệu cho thấy mọi người đang khao khát các mô hình mã nguồn mở hiệu năng cao đến mức “cực điểm”.
Chỉ trong một đêm đã tiến gần 2.900 lượt tải xuống; nếu tính đến yêu cầu phần cứng “khắc nghiệt” của mô hình này, thì lượng tải đó có giá trị cực cao.
Bởi vì thứ này khi khởi động thì riêng chi phí cho cụm máy chủ đã là vài chục triệu.
Bên Moonshot (Mặt Trăng Bóng Tối) lần này không “vắt sữa” thêm nữa.
Kiến trúc 2,8 T MoE, mật độ thông minh cao hơn trước 2,5 lần.
Điều này có nghĩa là họ không dựa vào việc “nhồi tham số” để đổi lấy cải thiện hiệu năng, mà là tối ưu hiệu quả ở cấp độ kiến trúc.
Hiểu biết trực quan gốc cộng thêm ngữ cảnh 1 M trở lên; cấu hình này về cơ bản là nhắm thẳng vào các mô hình đóng nguồn mạnh nhất hiện nay.
Thứ đáng thảo luận nhất là họ đã mở nguồn thư viện truyền thông cho MoE.
Ai từng chơi với mô hình lớn đều biết, phần khó nhất của kiến trúc MoE chính là hiệu suất truyền thông giữa nhiều GPU.
Kimi đã trực tiếp “cắn” khúc xương đó và mở nguồn; sau này khi mọi người làm các mô hình tham số lớn, sẽ không còn phải bắt đầu lại từ số 0 để tự mày mò tầng khung truyền thông phía dưới nữa.
Lần thao tác này đã kéo khoảng cách giữa mã nguồn mở và mã nguồn đóng xuống trong vòng chưa tới nửa năm.
Hiện tình hình trở nên rất thú vị:
Các mô hình mã nguồn đóng dựa vào “hiệu ứng quy mô” và lợi thế đi trước để phòng thủ, trong khi các lực lượng mã nguồn mở như K3 đang phá vỡ tuyến phòng thủ của đối phương thông qua việc mở toàn bộ stack.
Sự “mở” này không phải là một tư thế; mà là giao hẳn mã nguồn và chuỗi công cụ ra thật sự.
Với nhà phát triển và các đội ngũ khởi nghiệp, đây là một bước ngoặt.
Cuối cùng bạn đã có một thanh “kiếm hạng nặng” trong tay để có thể thay thế thậm chí vượt qua một phần các API mã nguồn đóng, dù thanh kiếm này rất nặng và cần điện toán đắt đỏ để múa, nhưng ít nhất thì nó hiện đang ở trong tay bạn.
Chỉ trong một đêm đã tiến gần 2.900 lượt tải xuống; nếu tính đến yêu cầu phần cứng “khắc nghiệt” của mô hình này, thì lượng tải đó có giá trị cực cao.
Bởi vì thứ này khi khởi động thì riêng chi phí cho cụm máy chủ đã là vài chục triệu.
Bên Moonshot (Mặt Trăng Bóng Tối) lần này không “vắt sữa” thêm nữa.
Kiến trúc 2,8 T MoE, mật độ thông minh cao hơn trước 2,5 lần.
Điều này có nghĩa là họ không dựa vào việc “nhồi tham số” để đổi lấy cải thiện hiệu năng, mà là tối ưu hiệu quả ở cấp độ kiến trúc.
Hiểu biết trực quan gốc cộng thêm ngữ cảnh 1 M trở lên; cấu hình này về cơ bản là nhắm thẳng vào các mô hình đóng nguồn mạnh nhất hiện nay.
Thứ đáng thảo luận nhất là họ đã mở nguồn thư viện truyền thông cho MoE.
Ai từng chơi với mô hình lớn đều biết, phần khó nhất của kiến trúc MoE chính là hiệu suất truyền thông giữa nhiều GPU.
Kimi đã trực tiếp “cắn” khúc xương đó và mở nguồn; sau này khi mọi người làm các mô hình tham số lớn, sẽ không còn phải bắt đầu lại từ số 0 để tự mày mò tầng khung truyền thông phía dưới nữa.
Lần thao tác này đã kéo khoảng cách giữa mã nguồn mở và mã nguồn đóng xuống trong vòng chưa tới nửa năm.
Hiện tình hình trở nên rất thú vị:
Các mô hình mã nguồn đóng dựa vào “hiệu ứng quy mô” và lợi thế đi trước để phòng thủ, trong khi các lực lượng mã nguồn mở như K3 đang phá vỡ tuyến phòng thủ của đối phương thông qua việc mở toàn bộ stack.
Sự “mở” này không phải là một tư thế; mà là giao hẳn mã nguồn và chuỗi công cụ ra thật sự.
Với nhà phát triển và các đội ngũ khởi nghiệp, đây là một bước ngoặt.
Cuối cùng bạn đã có một thanh “kiếm hạng nặng” trong tay để có thể thay thế thậm chí vượt qua một phần các API mã nguồn đóng, dù thanh kiếm này rất nặng và cần điện toán đắt đỏ để múa, nhưng ít nhất thì nó hiện đang ở trong tay bạn.




