A ByteDance lança o Seed Audio 1.0, gerando diálogos e efeitos sonoros a partir de um único prompt

De acordo com Beating, o Seed Audio 1.0 da ByteDance foi lançado a 22 de julho, permitindo a geração de diálogos, efeitos sonoros e áudio ambiente com precisão de temporização de 100 ms a partir de um único prompt. O modelo suporta entradas de texto e áudio de referência, pode gerar aproximadamente dois minutos de áudio por cada geração, com capacidade alargada, e mantém vozes consistentes das personagens entre os resultados.

O áudio demonstra mais de 90% de usabilidade na maioria dos cenários, com uma Mean Opinion Score (MOS) superior a 4 na maior parte dos idiomas suportados. O Seed Audio 1.0 suporta mais de 20 idiomas, com transferência de voz entre línguas e personalização do tom. O modelo está agora disponível através do centro de experiências Volcano Ark, com integração de API aberta.

Aviso legal: As informações contidas nesta página podem provir de fontes externas e têm caráter meramente informativo. Não refletem os pontos de vista nem as opiniões da Gate e não constituem qualquer tipo de aconselhamento financeiro, de investimento ou jurídico. A negociação de ativos virtuais envolve um risco elevado. Não se baseie exclusivamente nas informações contidas nesta página ao tomar decisões. Para mais detalhes, consulte o Aviso legal.
Comentar
0/400
Nenhum comentário