MiniMax научила синтезированный голос запинаться, чтобы его не отличить от живого

Новая TTS-модель MiniMax Speech 2.8 добавляет живые запинки и паузы, клонирует голос с 10 секунд записи и звучит на уровне студийной записи.

Aravana··1 мин

🔴 MiniMax научила синтезированный голос запинаться, чтобы его не отличить от живого

Китайская MiniMax выпустила модель озвучки Speech 2.8, и её главная фишка не в чистоте звука, а в несовершенстве. Модель вставляет живые «эм», «а-а» и паузы, копирует ритм и интонацию человеческой речи, а голос клонирует всего с 10-секундного образца. Звук при этом студийного качества, без фонового шума и артефактов.

Суть понятна: синтез речи вплотную подошёл к грани, за которой ухо перестаёт слышать «робота». Что за этим следует:

— голосовые ассистенты в поддержке и продажах, которых собеседник не распознаёт как ИИ; — мгновенный дубляж и локализация: 10 секунд записи, и готов синтетический двойник голоса; — и обратная сторона: клонирование голоса под мошенничество, к которому системы защиты пока не готовы.

Модель уже доступна через API и на платформе MiniMax Audio.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

#нейросети #LLM #модели #мультимодальность #Китай #автоматизация #ИИ #технологии #AravanaAI

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

DeepSeek заморозила раунд при оценке ~$67 млрд из-за пары вирусных постов

DeepSeek сообщила инвесторам о паузе во втором раунде на ~$1,4 млрд при оценке около $67 млрд — спустя недели после первого раунда на $7 млрд и на фоне вирусных постов основателя.

·1 мин

Первое железо OpenAI: клавиатура за $230, и кодеры морщатся

Первое железо OpenAI — клавиатура Micro за $230 с программируемыми клавишами-агентами и завязкой на ChatGPT и Codex — встречено целевой аудиторией прохладно.

·1 мин

Голос Claude научился делать работу, пока голос ChatGPT только болтает

Anthropic открыла голосовой режим для Opus, Sonnet и Haiku и научила его работать в чужих приложениях

·1 мин