A Alibaba Cloud adapta o LLM Kimi K3 e reduz a latência do primeiro token em 35%

BABA0,54%
De acordo com o Security Times, a Alibaba Cloud, a 27 de julho, adaptou as suas instâncias de supernó Lingjun Zhenwu M890 para executar o Kimi K3, um modelo de linguagem de larga escala. A otimização conjunta entre os chips, a plataforma de inferência e o modelo reduziu a latência do primeiro token — o tempo que um modelo demora a começar a apresentar resultados — em cerca de 35%, melhorando a fluidez das interações com contextos longos. A Alibaba Cloud também afirmou que disponibilizaria APIs para o Kimi K3 através da sua Plataforma de IA Qianwen e do Bailian, com ambos os lados aprofundando a cooperação no poder de computação nacional.
Aviso legal: As informações contidas nesta página podem provir de fontes externas e têm caráter meramente informativo. Não refletem os pontos de vista nem as opiniões da Gate e não constituem qualquer tipo de aconselhamento financeiro, de investimento ou jurídico. A negociação de ativos virtuais envolve um risco elevado. Não se baseie exclusivamente nas informações contidas nesta página ao tomar decisões. Para mais detalhes, consulte o Aviso legal.
Comentar
0/400
Nenhum comentário