Alibaba Cloud adapta Kimi K3 LLM y reduce la latencia del primer token en un 35%
Según Security Times, Alibaba Cloud, el 27 de julio, adaptó sus instancias de supernodo Lingjun Zhenwu M890 para ejecutar Kimi K3, un modelo de lenguaje amplio. La optimización conjunta en chips, la plataforma de inferencia y el modelo redujo la latencia del primer token —el tiempo que tarda un modelo en empezar a mostrar salida— en aproximadamente un 35%, mejorando la fluidez de las interacciones de contexto largo. Alibaba Cloud también dijo que proporcionaría APIs para Kimi K3 a través de su p
BABA-2,08%
GateNews·07-28 06:50
