Alibaba Cloud tối ưu Kimi K3 LLM, cắt giảm độ trễ token đầu tiên xuống 35%

BABA0,54%
Theo Security Times, vào ngày 27/7, Alibaba Cloud đã điều chỉnh các phiên bản supernode Lingjun Zhenwu M890 của mình để chạy Kimi K3, một mô hình ngôn ngữ lớn. Việc tối ưu hóa tổng thể trên phần cứng chip, nền tảng suy luận và mô hình đã giúp giảm khoảng 35% độ trễ token đầu tiên—tức thời gian mô hình bắt đầu hiển thị đầu ra—qua đó cải thiện độ mượt trong các tương tác với ngữ cảnh dài. Alibaba Cloud cũng cho biết họ sẽ cung cấp API cho Kimi K3 thông qua Qianwen AI Platform và Bailian, đồng thời hai bên sẽ tiếp tục tăng cường hợp tác về năng lực điện toán trong nước.
Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể đến từ các nguồn bên thứ ba và chỉ mang tính chất tham khảo. Thông tin này không phản ánh quan điểm hoặc ý kiến của Gate và không cấu thành bất kỳ lời khuyên tài chính, đầu tư hoặc pháp lý nào. Giao dịch tài sản ảo tiềm ẩn rủi ro cao. Vui lòng không chỉ dựa vào thông tin trên trang này khi đưa ra quyết định. Để biết thêm chi tiết, vui lòng xem Tuyên bố miễn trừ trách nhiệm.
Bình luận
0/400
Không có bình luận