A Alibaba Cloud adaptou o LLM Kimi K3 e reduziu em 35% a latência do primeiro token

BABA0,54%
De acordo com o Security Times, em 27 de julho a Alibaba Cloud adaptou suas instâncias de supernó Lingjun Zhenwu M890 para executar o Kimi K3, um modelo de linguagem de grande porte. A otimização conjunta entre chips, a plataforma de inferência e o modelo reduziu em aproximadamente 35% a latência do primeiro token — o tempo que o modelo leva para começar a exibir a saída — melhorando a fluidez das interações com contextos longos. A Alibaba Cloud também afirmou que disponibilizaria APIs para o Kimi K3 por meio de sua Qianwen AI Platform e do Bailian, com as duas partes aprofundando a cooperação em poder computacional doméstico.
Isenção de responsabilidade: as informações nesta página podem ter origem em fontes terceiras e servem apenas como referência. Não representam as opiniões da Gate e não constituem orientação financeira, de investimentos ou jurídica. A negociação de ativos virtuais envolve alto risco. Não tome decisões baseando-se apenas nas informações desta página. Para mais detalhes, consulte a Isenção de responsabilidade.
Comentário
0/400
Sem comentários