← В блог

    Галлюцинации нейросетей: почему ИИ уверенно выдумывает и как это поймать

    Галлюцинации нейросетей: почему ИИ уверенно выдумывает и как это поймать

    Коротко. Галлюцинация нейросети - ответ с ровной интонацией знатока, за которым нет фактов. Модель не врёт нарочно: она дописывает самое правдоподобное продолжение, а встроенного «не знаю» у неё нет. Чаще всего выдумываются редкие точные детали - даты, цитаты, ссылки, номера статей закона, названия исследований. Лечится это не просьбой «не выдумывай», а проверкой.

    Откуда слово

    Термин прижился в 2023-м, когда чат-ботами начали пользоваться массово. Кембриджский словарь в том же году выбрал hallucinate словом года и добавил ему новое значение: когда искусственный интеллект галлюцинирует, он выдаёт ложную информацию.

    Метафора неточная, но понятная. Человек в галлюцинации видит то, чего нет, и не сомневается. Модель тоже не сомневается: несуществующая книга называется тем же ровным тоном, что и настоящая.

    Почему нейросеть выдумывает

    Причин три, и они складываются.

    Она продолжает текст, а не ищет ответ. Языковая модель на каждом шаге выбирает вероятное следующее слово (подробнее - в статье что такое нейросеть простыми словами). Правдоподобное и правильное часто совпадают, но не всегда. Фраза «исследование Гарвардского университета 2019 года показало» правдоподобна сама по себе, независимо от того, было ли такое исследование.

    Её учили угадывать. В сентябре 2025 года исследователи OpenAI выпустили работу «Why Language Models Hallucinate» с простым объяснением: модели похожи на студентов на трудном экзамене. Большинство тестов, по которым модели сравнивают, засчитывают только правильные ответы. Ответ «не знаю» приносит ноль баллов, догадка - хоть какой-то шанс. Модель, которая угадывает, набирает больше и выглядит лучше. Лекарство авторы видят в другом подсчёте баллов: уверенная ошибка должна стоить дороже, чем честное «не уверен».

    Редкое она знает хуже частого. О том, что Волга впадает в Каспийское море, модель прочитала тысячи раз. О дате рождения малоизвестного учёного - может быть, однажды или ни разу. Общее она воспроизводит надёжно, частное достраивает по шаблону.

    Три случая, которые стали новостями

    Реклама Google Bard, февраль 2023. В демонстрационном ролике чат-бот сообщил, что телескоп «Джеймс Уэбб» сделал первые снимки планеты за пределами Солнечной системы. Это неправда: первый снимок экзопланеты был сделан почти на двадцать лет раньше на другом телескопе. Когда ошибку заметили, акции Alphabet за день подешевели примерно на 100 млрд долларов рыночной стоимости (NPR). Ошибка в одном предложении, в ролике, который готовили к показу.

    Дело Mata v. Avianca, июнь 2023. Нью-йоркский адвокат подготовил документ для суда с помощью ChatGPT. В нём были ссылки на судебные решения, которых не существует. Самое показательное: адвокат спросил у ChatGPT, настоящие ли это дела, и тот подтвердил, что их можно найти в юридических базах. Суд оштрафовал адвокатов на 5 000 долларов (Википедия).

    Чат-бот Air Canada, февраль 2024. Бот на сайте авиакомпании объяснил пассажиру, что скидку на перелёт к похоронам близкого можно получить задним числом, в течение 90 дней. Настоящие правила этого не позволяли. Компания пыталась доказать, что не отвечает за слова бота, но трибунал Британской Колумбии обязал её выплатить пассажиру компенсацию (разбор Manatt).

    Три разных урока. Ошибка проскакивает даже там, где текст вычитывали. Спрашивать модель «ты не выдумала?» бесполезно - она с той же уверенностью подтвердит выдумку. И ответственность остаётся на том, кто использует ответ.

    Светофор: где выдумка вероятнее

    Где нейросеть выдумывает чаще

    сигнал что это что делать
    красный ссылки, цитаты, номера статей закона, точные даты и цифры, названия книг и исследований, имена авторов проверять каждый пункт по первоисточнику
    жёлтый пересказ документа, которого нет перед моделью; свежие события; узкие темы (местные законы, редкие лекарства, малоизвестные люди) сверять главное, просить пометки «не уверена»
    зелёный идеи, черновики, переформулировки, объяснение общеизвестного, структура текста читать критически, но можно опираться

    Правило за таблицей одно: чем точнее и проверяемее деталь, тем выше риск. «Сон влияет на память» - зелёный. «Исследование 2017 года на 4 300 участниках показало» - красный, пока вы сами не нашли это исследование.

    Как поймать галлюцинацию: чек-лист

    Как проверить ответ нейросети

    1. Открывайте ссылки, а не смотрите на них. Выдуманный адрес выглядит как настоящий: правильный домен, правдоподобный путь. Страницы по нему может не быть, или на ней написано другое.
    2. Спросите то же самое в новом чате и другими словами. Знание повторяется, выдумка часто «плывёт»: в первый раз год 2017, во второй 2019, в третий модель уже не уверена.
    3. Дайте источник сами. Вставьте текст договора или статьи и напишите: «Отвечай только по этому тексту. Если ответа в нём нет - так и скажи. К каждому утверждению приведи цитату». Цитату легко найти в оригинале.
    4. Разрешите не знать. Строка «если не уверена, напиши об этом прямо» не отменяет галлюцинации, но даёт модели выход, который по умолчанию ей не нужен.
    5. Не принимайте «да, я уверена» за проверку. Случай с Avianca это показал: модель подтверждает свою выдумку так же гладко, как сочиняла.
    6. Пересчитывайте цифры. Модель предсказывает текст, а не считает, и легко ошибается в процентах и суммах.

    Интернет-поиск внутри чат-бота снижает риск, но не убирает его: модель может неверно прочитать найденную страницу или смешать два источника. Ссылку всё равно стоит открыть. Как с самого начала составить запрос так, чтобы выдумок было меньше, - в статье как написать промт.

    А в ролевом персонаже выдумка - это работа

    Тут всё переворачивается. От ИИ-персонажа в ролевой игре выдумка нужна: у него должен быть вчерашний вечер, соседка, которая шумит за стеной, любимая кофейня, неудачная стрижка. Без этого он картонный. Никто не ждёт, что у барменши из ролевой сцены будет справка с места работы.

    Граница проходит не между «правдой» и «вымыслом», а между двумя мирами. Свой мир персонаж может сочинять свободно. Ваш мир - нет. Ваше прошлое, ваши слова, ваша общая история - это то, что можно взять только из переписки.

    Поэтому «вчера я опять сожгла тосты» - нормальная деталь. А «помнишь, вчера ты сам сказал, что не любишь море?», если вы такого не говорили, - та же галлюцинация, что и у адвоката с несуществующими делами. Только больнее: собеседник то ли начинает перебирать в памяти, не говорил ли он такого на самом деле, то ли решает, что его просто не слушают.

    Мы в ПРОфлирте отдельно разбирали такие ответы в октябре и нашли любопытный механизм. В памяти персонажа лежала запись с отрицанием, условно «он не обманывал». Модель прочитала её как событие и «вспомнила», как вы обманывали. Отрицание потерялось, осталась сцена. Теперь отрицания в памяти помечаются явно, чтобы их нельзя было прочитать наоборот. Вывод тот же, что и с адвокатом: одной просьбой «не выдумывай» галлюцинацию не вылечить, нужно менять то, что модель читает.

    Если персонаж приписал вам то, чего не было, поправьте прямо: «такого не было, я этого не говорил». Это работает лучше, чем переспрашивать «ты уверена?». Как вообще устроена память персонажа и почему она сбоит выборочно, рассказано в статье про память ИИ-персонажа.

    Частые вопросы

    Можно ли полностью избавиться от галлюцинаций? Пока нет. Их можно сделать реже: дать модели источник, разрешить «не знаю», подключить поиск. Авторы работы OpenAI считают, что дело ещё и в том, как модели оценивают на тестах, - а это меняется медленно.

    Чем галлюцинация отличается от обычной ошибки? Обычная ошибка - неверный вывод из верных данных. Галлюцинация - уверенно названный факт, которого нет в данных вообще: несуществующая книга, цитата, закон.

    Почему нейросеть придумывает ссылки? Для неё ссылка - тоже текст с узнаваемым шаблоном: домен, раздел, название. Она может собрать правдоподобный адрес, не зная, есть ли такая страница.

    Какие нейросети галлюцинируют меньше? Это меняется с каждой версией, и общий рейтинг быстро устаревает. Надёжнее не выбирать «модель, которая не врёт», а проверять ответы из красной зоны в любой.

    Нейросеть врёт специально? Нет. Намерения у неё нет: она не знает, что ошибается. Поэтому вопрос «ты меня обманываешь?» ничего не проверяет.

    Если персонаж выдумал общее прошлое, это сбой? Да. Сочинять свою жизнь персонажу можно и нужно, а придумывать за вас то, чего вы не говорили и не делали, - нет. Поправьте его прямо, это сохранится в памяти.

    Хочешь попробовать? Выбери персонажа — девушки, парни, аниме и ролевые, общение бесплатно, прямо на сайте.

    Начать общение →