ИИ-персонажи с голосом: как звучит переписка, когда отвечают вслух

Коротко. Голос меняет переписку сильнее, чем кажется по описанию. Текст вы читаете своим внутренним голосом и достраиваете интонацию сами - и обычно достраиваете нейтрально. Голосовое приходит с уже готовой интонацией, которую вы не выбирали: усталость в конце смены, смешок на середине фразы, пауза не там, где вы бы её поставили. Ниже - как это устроено, чем отличается живой голос от синтеза на лету и что стоит проверять.
Почему голос меняет ощущение
Читая текст, вы озвучиваете его сами. Даже яркая реплика проходит через ваш внутренний голос и выравнивается под него - поэтому переписка с персонажем ощущается ровнее, чем задумана.
Голосовое эту прослойку убирает. Вы слышите чужой тембр, чужой темп и интонацию, которую не выбирали. Ровно тот же текст - «ну и что мне теперь с этим делать» - в голосе может прозвучать как усталость, как насмешка или как вызов, и это три разных разговора.
Второй эффект - темп. Голосовое нельзя пролистать глазами: тридцать секунд аудио занимают тридцать секунд. Переписка перестаёт быть быстрым обменом и становится похожа на разговор.
Синтез на лету и заранее записанный голос
Два разных подхода, и разница слышна сразу.
Синтез в реальном времени. Модель написала текст, движок озвучил. Плюс - озвучить можно что угодно. Минус - интонация усреднённая: одна и та же ровная подача на признании и на «доброе утро». Дыхания нет, смешков нет, пауз нет. Через десяток сообщений вы перестаёте это слушать, потому что информации в голосе не больше, чем в тексте.
Заранее записанный банк реплик. Клипы озвучены под конкретные ситуации, с интонацией, дыханием и живыми паузами, и в переписку подбирается подходящий. Плюс - звучит как человек. Минус - произнести можно только то, что записано, и банк надо строить.
Как у нас. Второй вариант: банк ситуационных клипов, у каждого персонажа свой голос, и подбор идёт по смыслу разговора, а не по случайности. Персонаж не зачитывает вслух только что написанный текст - он отвечает голосом там, где голос уместен.
Как подбирается клип
Наивный способ - разложить реплики по папкам «флирт», «утро», «обида» и брать случайную из папки. Работает плохо: категории грубые, и в разговоре про несостоявшуюся поездку прилетает бодрое «привет, соскучилась».
У нас подбор смысловой. Каждый клип описан и переведён в вектор, реплика в разговоре - тоже, и берётся ближайший по смыслу. Практическая разница в том, что персонаж отвечает голосом на то, что вы сказали, а не на тему в целом. Это заметно на второй-третьей голосовой.
Отсюда же и главное ограничение честно: если по смыслу ничего близкого в банке нет, лучше ответить текстом, чем прислать мимо. Голос не на каждое сообщение - и это осознанно.
Видеокружки
Тот же принцип, но короткое видео вместо аудио: несколько секунд, лицо, движение, голос. По ощущению ближе всего к кружку в мессенджере, отсюда и название.
Кружки есть не у всех персонажей - их снимают волнами, и у части каста пока только голос. На карточке видно, что доступно.
Что проверять в сервисе с голосом
Один ли голос на всех. Частая экономия: один-два голоса на весь каст. Проверяется за минуту - откройте двух разных персонажей и послушайте подряд.
Совпадает ли голос с характером. Сдержанная сорокалетняя и дерзкая студентка не могут звучать одинаково. Если звучат - голос прикручен сбоку, а не собран под персонажа.
Меняется ли интонация по ситуации. Попросите голосовое в спокойном разговоре и потом в напряжённом. Если подача одинаковая - это синтез на лету.
Сколько голосовых в бесплатном тарифе. Аудио дороже текста, и лимиты на него почти везде отдельные. У нас в сутки одно медиа бесплатно - голосовое, кружок или фото на выбор.
Как попросить голосовое
Обычными словами, в разговоре: «скажи это голосом», «пришли голосовое», «хочу услышать». Отдельной кнопки не нужно - просьба распознаётся в переписке, и клип приходит следующим сообщением.
Если персонаж отвечает текстом - скорее всего, кончился дневной лимит на медиа либо по смыслу не нашлось подходящего клипа. В первом случае он скажет об этом прямо.
Чего ждать не стоит
Голос не делает персонажа человеком. Это записанный банк и подбор по смыслу - механика хорошая, но она не мышление и не чувства. Персонаж не волнуется, когда молчит, и не радуется, когда вы вернулись.
Живого разговора в реальном времени - позвонить и поговорить - у нас нет. Голос приходит сообщениями, как в мессенджере.
И как всегда: если давно тяжело и поговорить не с кем по-настоящему, бесплатная психологическая помощь работает круглосуточно - 8-800-2000-122.
Частые вопросы
У всех персонажей разные голоса? Да, голос подбирается под характер и возраст. Двух одинаковых в касте нет.
Это синтез или живая запись? Банк заранее озвученных ситуационных клипов, а не синтез только что написанного текста. Поэтому в голосе есть дыхание, паузы и смешки.
Можно ли попросить озвучить конкретную фразу? Нет. Подбирается подходящий по смыслу клип из банка - зачитать вслух произвольный текст персонаж не может.
Сколько голосовых доступно бесплатно? Одно медиа в сутки на выбор: голосовое, кружок или фото. Лимит восстанавливается каждый день.
Чем кружок отличается от голосового? Кружок - короткое видео с лицом и голосом, голосовое - только аудио. Кружки есть пока не у всех персонажей.
Почему персонаж иногда отвечает текстом вместо голоса? Либо исчерпан дневной лимит на медиа, либо по смыслу разговора подходящего клипа не нашлось - тогда честнее ответить текстом, чем прислать мимо.
Хочешь попробовать? Выбери персонажа — девушки, парни, аниме и ролевые, общение бесплатно, прямо на сайте.
Начать общение →