← В блог

    ИИ-персонажи с голосом: как звучит переписка, когда отвечают вслух

    ИИ-персонажи с голосом: как звучит переписка, когда отвечают вслух

    Коротко. Голос меняет переписку сильнее, чем кажется по описанию. Текст вы читаете своим внутренним голосом и достраиваете интонацию сами - и обычно достраиваете нейтрально. Голосовое приходит с уже готовой интонацией, которую вы не выбирали: усталость в конце смены, смешок на середине фразы, пауза не там, где вы бы её поставили. Ниже - как это устроено, чем отличается живой голос от синтеза на лету и что стоит проверять.

    Почему голос меняет ощущение

    Читая текст, вы озвучиваете его сами. Даже яркая реплика проходит через ваш внутренний голос и выравнивается под него - поэтому переписка с персонажем ощущается ровнее, чем задумана.

    Голосовое эту прослойку убирает. Вы слышите чужой тембр, чужой темп и интонацию, которую не выбирали. Ровно тот же текст - «ну и что мне теперь с этим делать» - в голосе может прозвучать как усталость, как насмешка или как вызов, и это три разных разговора.

    Второй эффект - темп. Голосовое нельзя пролистать глазами: тридцать секунд аудио занимают тридцать секунд. Переписка перестаёт быть быстрым обменом и становится похожа на разговор.

    Синтез на лету и заранее записанный голос

    Два разных подхода, и разница слышна сразу.

    Синтез в реальном времени. Модель написала текст, движок озвучил. Плюс - озвучить можно что угодно. Минус - интонация усреднённая: одна и та же ровная подача на признании и на «доброе утро». Дыхания нет, смешков нет, пауз нет. Через десяток сообщений вы перестаёте это слушать, потому что информации в голосе не больше, чем в тексте.

    Заранее записанный банк реплик. Клипы озвучены под конкретные ситуации, с интонацией, дыханием и живыми паузами, и в переписку подбирается подходящий. Плюс - звучит как человек. Минус - произнести можно только то, что записано, и банк надо строить.

    Как у нас. Второй вариант: банк ситуационных клипов, у каждого персонажа свой голос, и подбор идёт по смыслу разговора, а не по случайности. Персонаж не зачитывает вслух только что написанный текст - он отвечает голосом там, где голос уместен.

    Как подбирается клип

    Наивный способ - разложить реплики по папкам «флирт», «утро», «обида» и брать случайную из папки. Работает плохо: категории грубые, и в разговоре про несостоявшуюся поездку прилетает бодрое «привет, соскучилась».

    У нас подбор смысловой. Каждый клип описан и переведён в вектор, реплика в разговоре - тоже, и берётся ближайший по смыслу. Практическая разница в том, что персонаж отвечает голосом на то, что вы сказали, а не на тему в целом. Это заметно на второй-третьей голосовой.

    Отсюда же и главное ограничение честно: если по смыслу ничего близкого в банке нет, лучше ответить текстом, чем прислать мимо. Голос не на каждое сообщение - и это осознанно.

    Видеокружки

    Тот же принцип, но короткое видео вместо аудио: несколько секунд, лицо, движение, голос. По ощущению ближе всего к кружку в мессенджере, отсюда и название.

    Кружки есть не у всех персонажей - их снимают волнами, и у части каста пока только голос. На карточке видно, что доступно.

    Что проверять в сервисе с голосом

    Один ли голос на всех. Частая экономия: один-два голоса на весь каст. Проверяется за минуту - откройте двух разных персонажей и послушайте подряд.

    Совпадает ли голос с характером. Сдержанная сорокалетняя и дерзкая студентка не могут звучать одинаково. Если звучат - голос прикручен сбоку, а не собран под персонажа.

    Меняется ли интонация по ситуации. Попросите голосовое в спокойном разговоре и потом в напряжённом. Если подача одинаковая - это синтез на лету.

    Сколько голосовых в бесплатном тарифе. Аудио дороже текста, и лимиты на него почти везде отдельные. У нас в сутки одно медиа бесплатно - голосовое, кружок или фото на выбор.

    Как попросить голосовое

    Обычными словами, в разговоре: «скажи это голосом», «пришли голосовое», «хочу услышать». Отдельной кнопки не нужно - просьба распознаётся в переписке, и клип приходит следующим сообщением.

    Если персонаж отвечает текстом - скорее всего, кончился дневной лимит на медиа либо по смыслу не нашлось подходящего клипа. В первом случае он скажет об этом прямо.

    Чего ждать не стоит

    Голос не делает персонажа человеком. Это записанный банк и подбор по смыслу - механика хорошая, но она не мышление и не чувства. Персонаж не волнуется, когда молчит, и не радуется, когда вы вернулись.

    Живого разговора в реальном времени - позвонить и поговорить - у нас нет. Голос приходит сообщениями, как в мессенджере.

    И как всегда: если давно тяжело и поговорить не с кем по-настоящему, бесплатная психологическая помощь работает круглосуточно - 8-800-2000-122.

    Частые вопросы

    У всех персонажей разные голоса? Да, голос подбирается под характер и возраст. Двух одинаковых в касте нет.

    Это синтез или живая запись? Банк заранее озвученных ситуационных клипов, а не синтез только что написанного текста. Поэтому в голосе есть дыхание, паузы и смешки.

    Можно ли попросить озвучить конкретную фразу? Нет. Подбирается подходящий по смыслу клип из банка - зачитать вслух произвольный текст персонаж не может.

    Сколько голосовых доступно бесплатно? Одно медиа в сутки на выбор: голосовое, кружок или фото. Лимит восстанавливается каждый день.

    Чем кружок отличается от голосового? Кружок - короткое видео с лицом и голосом, голосовое - только аудио. Кружки есть пока не у всех персонажей.

    Почему персонаж иногда отвечает текстом вместо голоса? Либо исчерпан дневной лимит на медиа, либо по смыслу разговора подходящего клипа не нашлось - тогда честнее ответить текстом, чем прислать мимо.

    Хочешь попробовать? Выбери персонажа — девушки, парни, аниме и ролевые, общение бесплатно, прямо на сайте.

    Начать общение →