Alibaba Cloud adapta Kimi K3 LLM y reduce la latencia del primer token en un 35%

BABA0,54%
Según Security Times, Alibaba Cloud, el 27 de julio, adaptó sus instancias de supernodo Lingjun Zhenwu M890 para ejecutar Kimi K3, un modelo de lenguaje amplio. La optimización conjunta en chips, la plataforma de inferencia y el modelo redujo la latencia del primer token —el tiempo que tarda un modelo en empezar a mostrar salida— en aproximadamente un 35%, mejorando la fluidez de las interacciones de contexto largo. Alibaba Cloud también dijo que proporcionaría APIs para Kimi K3 a través de su plataforma de IA Qianwen y Bailian, y que ambas partes profundizarán la cooperación en potencia de cómputo nacional.
Aviso legal: La información en esta página puede provenir de fuentes de terceros y es solo para referencia. No representa las opiniones ni puntos de vista de Gate y no constituye asesoramiento financiero, de inversión ni legal. El comercio de activos virtuales implica un alto riesgo. No te bases únicamente en la información presentada en esta página para tomar decisiones. Para más detalles, consulta el Aviso legal.
Comentar
0/400
Sin comentarios