MiniMax научила синтезированный голос запинаться, чтобы его не отличить от живого
Новая TTS-модель MiniMax Speech 2.8 добавляет живые запинки и паузы, клонирует голос с 10 секунд записи и звучит на уровне студийной записи.
🔴 MiniMax научила синтезированный голос запинаться, чтобы его не отличить от живого
Китайская MiniMax выпустила модель озвучки Speech 2.8, и её главная фишка не в чистоте звука, а в несовершенстве. Модель вставляет живые «эм», «а-а» и паузы, копирует ритм и интонацию человеческой речи, а голос клонирует всего с 10-секундного образца. Звук при этом студийного качества, без фонового шума и артефактов.
Суть понятна: синтез речи вплотную подошёл к грани, за которой ухо перестаёт слышать «робота». Что за этим следует:
— голосовые ассистенты в поддержке и продажах, которых собеседник не распознаёт как ИИ; — мгновенный дубляж и локализация: 10 секунд записи, и готов синтетический двойник голоса; — и обратная сторона: клонирование голоса под мошенничество, к которому системы защиты пока не готовы.
Модель уже доступна через API и на платформе MiniMax Audio.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
#нейросети #LLM #модели #мультимодальность #Китай #автоматизация #ИИ #технологии #AravanaAI
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.