смуззИИ
Инструкции

Как озвучить текст нейросетью Gemini 3.8: голос, подача и диалог двумя голосами

Обновлено 30 сентября 2026 · 5 мин чтения

Студия Аудио смуззИИ на телефоне: меню движков с Gemini 3.8 Flash и Lite и готовая озвучка

Покажем озвучку на Gemini 3.8 на одной задаче целиком. Кофейне к открытию нужны две вещи: рекламный ролик для радио у дома и короткая сценка для соцсетей, где два фирменных стаканчика спорят, кто шуршит в холодильнике. Первое делается во вкладке «Озвучка», второе — в «Диалогах».

Шаг 1. Переключи движок

Раскрытое меню «Движок» в студии Аудио: семь движков с ценой минуты, выбран Gemini 3.8 Flash

В студии Аудио под полем для текста есть кнопка «Движок: …». Она раскрывает список, где у каждого движка написана цена минуты звучания; дорогие стоят выше, лёгкие ниже. Две последние строки — это и есть Gemini 3.8.

Разница между ними короткая. Flash — старшая версия, Lite легче и отдаёт звук заметно быстрее. Голоса и настройки у них общие, так что можно записать один и тот же текст обоими и сравнить на слух — готовые пары для сравнения лежат на странице Gemini 3.8 TTS.

Шаг 2. Вставь рекламный текст

Вкладка «Озвучка» с движком Gemini 3.8 Flash: рекламный текст в поле, голос Кора, цена на кнопке
Подсказка в студии

Вставь текст, который нужно озвучить

Голос прочитает его слово в слово — как написано, так и прозвучит.

Выбери голос и жми «смуззИИ»

Каждый голос можно послушать в списке. Стоимость генерации будет указана на кнопке, спишем по длине готового звука.

Для радио текст пишется короче, чем кажется нужным: секунд на двадцать-тридцать, одно предложение — одна мысль. Нашей кофейне хватило трёх фраз про новое меню и адрес.

Паузы и акценты задаёт пунктуация, а эмоцию — пометки в квадратных скобках прямо в тексте. Gemini их отыгрывает, а не произносит: [laughs] превращается в смешок, [whispers] — в шёпот. Мы проверили четыре таких пометки — ещё [sighs] и [shouting], — все четыре сработали на обеих версиях.

Голос выбирается кнопкой рядом с движком; любой из тридцати можно прослушать в списке до запуска.

Шаг 3. Настрой подачу под рекламу

Открытая «Подача» у Gemini 3.8: выбрана манера «С улыбкой», ниже темп и акцент

Кнопка «Подача» — главное отличие Gemini от обычного синтеза речи. Для нашего ролика подошла манера «С улыбкой». Если нужен бодрый эфир, есть «Реклама, на драйве»; рядом темп и акцент, а под ними — раздел «Характер и сцена», куда своими словами пишешь, кто говорит и где это звучит.

Любую настройку можно оставить на «Как выйдет» — тогда голос читает по своему разумению.

Шаг 4. Собери сценку на двоих

Вкладка «Диалоги» с движком Gemini 3.8 Flash: три реплики, голоса Зефира и Пак
Подсказка в студии

Впиши реплики героев

У каждой строки свой голос — он выбирается над ней. Ещё строку добавит «Добавить реплику».

Выбери голоса и жми «смуззИИ»

Стоимость генерации будет указана на кнопке, спишем по длине готового звука.

Во вкладке «Диалоги» поставь в меню «Движок» Gemini 3.8. Сценка пишется построчно: над каждой репликой свой голос, «Добавить реплику» даёт новую строку, порядок меняется перетаскиванием за точки слева.

Для Gemini в сцене два голоса. Когда оба уже заняты, новая реплика подставляет один из них, а в меню голосов остаются только эти двое — третьего модель не примет, и студия не даст его выбрать.

«Подача» в диалоге: сверху переключатель Зефира · Пак, у каждого голоса своя манера и темп

В «Подаче» у диалога сверху переключатель между двумя героями. В нашей сценке Зефира говорит шёпотом, а Пак — скороговоркой: настройки у каждого свои. Сцена и «живость» задаются одни на весь диалог.

Шаг 5. Запусти и послушай

Готовая озвучка на экране студии: плеер, кнопки скачать и поделиться, подсказка «Звук готов»
Подсказка в студии

Звук готов

Послушай его и скачай стрелкой справа. Поделиться — через три точки.

Перед числом на кнопке стоит «~»: до запуска длина звука неизвестна, поэтому там оценка по тексту. После готовности считаем по фактической длине: звук вышел короче — разница сразу вернётся на баланс, длиннее — спишем недостающее по той же ставке. Минимальный счёт — одна минута звучания, так что двадцатисекундный ролик стоит как минута.

Готовый файл встаёт на экран студии — его можно прослушать, скачать или отправить дальше. Прошлые озвучки лежат в «Работах».

Частые вопросы

Почему на кнопке «~» перед ценой?

Точную длину звука заранее не знает никто — ни мы, ни модель. Поэтому до запуска на кнопке оценка по тексту, а итог считается по готовому файлу.

Можно ли в диалоге больше двух героев?

На Gemini — нет: два голоса на сцену, это предел самой модели. Студия не даст выбрать третий, чтобы запрос не упал уже после нажатия.

Что делать, если голос сыграл не так?

Поменяй манеру в «Подаче» или допиши в «Характер и сцена», кто говорит и в какой обстановке. Разные голоса читают один текст по-разному — попробуй двух-трёх, их можно прослушать до запуска.

Сколько текста за один раз?

До 5000 символов. Это примерно пять-шесть минут речи.

Хватит читать — делай

Всё из этой статьи повторяется в смуззИИ за несколько минут. Без VPN, оплата в рублях.