ByteDance lanza Seed Audio 1.0: genera diálogos y efectos de sonido a partir de un único prompt

Según Beating, Seed Audio 1.0 de ByteDance se lanzó el 22 de julio y permite generar diálogo, efectos de sonido y audio ambiental con una precisión de temporización de 100 ms mediante un único prompt. El modelo admite entradas de texto y audio de referencia; puede producir aproximadamente dos minutos de audio por generación con capacidad ampliada, y mantiene voces de personajes consistentes en todas las salidas.

El audio muestra más de un 90% de usabilidad en la mayoría de los escenarios, con un Mean Opinion Score (MOS) superior a 4 en la mayor parte de los idiomas admitidos. Seed Audio 1.0 admite más de 20 idiomas con transferencia de voz entre idiomas y personalización del tono. El modelo ya está disponible a través del centro de experiencias Volcano Ark, con una integración de API abierta.

Aviso legal: La información en esta página puede provenir de fuentes de terceros y es solo para referencia. No representa las opiniones ni puntos de vista de Gate y no constituye asesoramiento financiero, de inversión ni legal. El comercio de activos virtuales implica un alto riesgo. No te bases únicamente en la información presentada en esta página para tomar decisiones. Para más detalles, consulta el Aviso legal.
Comentar
0/400
Sin comentarios