ByteDance запускает Seed Audio 1.0 — генерирует диалоги и звуковые эффекты из одного промпта

Согласно Beating, Seed Audio 1.0 от ByteDance был запущен 22 июля. Он позволяет генерировать диалоги, звуковые эффекты и фоновое аудио одним запросом с точностью тайминга 100 мс. Модель поддерживает текстовые и входные данные референсного аудио, может генерировать примерно до двух минут аудио за одну генерацию, обладает расширенными возможностями и сохраняет стабильные голоса персонажей в результатах.

Аудио демонстрирует более 90% удобства в большинстве сценариев, при этом Mean Opinion Score (MOS) превышает 4 в большинстве поддерживаемых языков. Seed Audio 1.0 поддерживает 20+ языков с межъязыковой передачей голоса и настройкой тона. Теперь модель доступна через центр опыта Volcano Ark, при этом интеграция API открыта.

Дисклеймер: Информация на этой странице может быть получена из источников третьих сторон и предоставляется только для ознакомления. Она не отражает взгляды или мнения Gate и не является финансовой, инвестиционной или юридической рекомендацией. Торговля виртуальными активами связана с высоким риском. Пожалуйста, не основывайте свои решения исключительно на данных этой страницы. Подробнее смотрите в Дисклеймере.
комментарий
0/400
Нет комментариев