De acordo com Beating, o Seed Audio 1.0 da ByteDance foi lançado a 22 de julho, permitindo a geração de diálogos, efeitos sonoros e áudio ambiente com precisão de temporização de 100 ms a partir de um único prompt. O modelo suporta entradas de texto e áudio de referência, pode gerar aproximadamente dois minutos de áudio por cada geração, com capacidade alargada, e mantém vozes consistentes das personagens entre os resultados.
O áudio demonstra mais de 90% de usabilidade na maioria dos cenários, com uma Mean Opinion Score (MOS) superior a 4 na maior parte dos idiomas suportados. O Seed Audio 1.0 suporta mais de 20 idiomas, com transferência de voz entre línguas e personalização do tom. O modelo está agora disponível através do centro de experiências Volcano Ark, com integração de API aberta.