← В блог

    Что такое токены в нейросети: почему русский дороже английского и куда девается длинный разговор

    Что такое токены в нейросети: почему русский дороже английского и куда девается длинный разговор

    Коротко. Токен - кусок текста, которым считает нейросеть: целое слово, часть слова или знак препинания. В токенах модель читает, пишет, помнит и выставляет счёт. Мы проверили на своих текстах: русское слово в среднем занимает около двух токенов, английское - чуть больше одного. Контекстное окно - сколько токенов модель видит за один раз; всё, что в него не попало, для неё не существует. А длинный разговор дорожает с каждой репликой, потому что модель каждый раз перечитывает его целиком.

    Как текст превращается в токены

    Как текст режется на токены

    Модель не видит букв и слов. Перед тем как текст попадёт внутрь, специальная программа - токенизатор - режет его на куски из своего словаря и заменяет каждый кусок номером. С номерами модель и работает.

    Словарь собирают заранее из огромного количества текстов: частые сочетания букв становятся отдельными токенами, редкие собираются из нескольких. Вот как режет фразы токенизатор GPT-4o (мы проверили через открытую библиотеку tiktoken 8 октября 2026 года):

    • «Привет, как дела?» → Пр ивет , как дела ? - шесть токенов;
    • «нейросеть» → ней рос еть - три;
    • «Здравствуйте» - один токен целиком, слово встречалось достаточно часто.

    У другой модели словарь другой, и счёт тоже. Токенизатор DeepSeek-V3 (он опубликован вместе с моделью) режет «Здравствуйте» на пять кусков, а «Я тебя люблю» - на пять вместо трёх у GPT-4o. Словарь у GPT-4o около 200 тысяч токенов, у DeepSeek-V3 около 128 тысяч.

    Отсюда первое практическое следствие: «сколько токенов в слове» зависит от модели, и одна и та же фраза у разных нейросетей стоит по-разному.

    Почему русский текст «тяжелее» английского

    Мы взяли нашу статью про память персонажа (около 900 слов) и подборку первых реплик наших персонажей, прогнали через три токенизатора и сравнили с английским текстом похожего стиля.

    токенизатор русский, токенов на слово английский, токенов на слово
    GPT-4 (cl100k_base) 3,1 1,1
    GPT-4o (o200k_base) 1,9 1,1
    DeepSeek-V3 2,1-2,2 1,1

    Замер наш, 8 октября 2026, на небольшом объёме текста - это порядок величины, а не константа. Но порядок говорит о многом: одна и та же мысль по-русски занимает почти вдвое больше токенов. У старого токенизатора GPT-4 разница была почти втрое; в новых словарях русских кусков больше, и разрыв сократился.

    Причин две. Словари строят на текстах, где английского обычно больше, поэтому английские слова чаще попадают туда целиком. И у русского богаче формы слова: «дом», «дома», «домом», «домами» - для токенизатора это разные последовательности, и каждую приходится собирать.

    Для пользователя это значит две вещи: в то же окно помещается меньше русского текста, а при оплате за токены русский разговор обходится дороже.

    Промт, контекст и окно: что модель видит на самом деле

    Промт - это текст запроса к модели (как его составить, разобрано в статье как написать промт). Когда вы отправляете сообщение в чат, модель получает не только его. В запрос собирается всё сразу:

    • инструкции сервиса (как отвечать, чего не делать);
    • описание персонажа или роли;
    • то, что сервис сохранил о вас в памяти;
    • история разговора;
    • ваше новое сообщение.

    Всё это вместе и есть промт в широком смысле - полный текст, на который модель отвечает. А контекстное окно - предел этого текста в токенах. Ответ модели тоже считается в токенах и тоже ограничен.

    Окна у современных моделей большие. Например, у моделей DeepSeek в API, по официальной странице на 8 октября 2026 года, - 1 миллион токенов. По нашему замеру токенизатора DeepSeek-V3 это порядка 470 тысяч русских слов. Как правильно составить сам запрос, мы разбирали в шаблонах промтов для ролевой игры.

    Почему персонаж «забывает» длинный разговор

    Почему длинный разговор забывается

    Если окно такое большое, откуда забывчивость? Причин три, и до предела окна обычно дело не доходит.

    Сервис сам обрезает историю. Отправлять модели весь разговор за месяц на каждую реплику - долго и дорого (почему дорого - ниже). Поэтому в запрос попадает хвост последних сообщений и сжатая выжимка остального. Что не попало в выжимку, для модели исчезло.

    Середина теряется. Даже то, что в окно попало, модель использует неравномерно. В исследовании «Lost in the Middle» (исследователи Стэнфорда и соавторы, опубликовано в журнале TACL в 2024 году) модели лучше находили нужный факт, когда он стоял в начале или в конце длинного текста, и заметно хуже - когда в середине. Большое окно - ещё не внимательное чтение.

    Выжимка огрубляет. Пересказ тысячи сообщений в двух абзацах неизбежно теряет детали: общая линия остаётся, точная фраза - не всегда.

    Что с этим делать в любом чате:

    • важное повторяйте ближе к концу, а не надейтесь, что модель найдёт его в середине;
    • в длинном рабочем диалоге просите время от времени: «перечисли, о чём мы договорились» - и поправляйте ошибки сразу;
    • новую тему начинайте в новом чате: старый разговор занимает окно и отвлекает модель.

    Как память устроена у ИИ-персонажей - извлечённые факты, поиск по прошлым разговорам и пересказ отношений - рассказано в отдельной статье про память ИИ-персонажа.

    Сколько стоят токены

    Компании, которые подключают нейросети через API, платят за каждый токен: отдельно за прочитанные (входящие) и за написанные (исходящие). Цены на официальных страницах на 8 октября 2026 года:

    модель за что цена
    DeepSeek, flash 1 млн входящих токенов (вне пиковых часов) $0,15
    DeepSeek, flash 1 млн исходящих токенов (вне пиковых часов) $0,60
    YandexGPT Pro 5.1 1 000 токенов, входящие и исходящие 0,80 ₽
    Alice AI LLM Flash 1 000 входящих / исходящих токенов 0,10 ₽ / 0,20 ₽

    Источники: DeepSeek API, Yandex AI Studio (синхронный режим, с НДС). В пиковые часы DeepSeek берёт вдвое больше.

    Теперь главное: почему длинный разговор дорожает. Возьмём вечер переписки - 100 ваших сообщений и 100 ответов, по 40 слов каждое. В токенах DeepSeek-V3 это примерно 85 токенов на сообщение, а весь вечер - около 17 тысяч токенов текста.

    Но модель на каждом ходу перечитывает всю историю. Для первого ответа - почти пустую, для сотого - все 17 тысяч. Если сложить, за вечер модель прочитает около 850 тысяч токенов при 17 тысячах написанных. В пятьдесят раз больше. И это без инструкций и описания персонажа, которые тоже едут в каждом запросе.

    По ценам из таблицы такие 850 тысяч входящих токенов стоят около 13 центов у DeepSeek flash и около 680 рублей у YandexGPT Pro 5.1. Сравнение грубое: у каждой модели свой токенизатор, и тот же текст в её счёте может занять другое число токенов. Зато видно, почему сервисы не тащат в запрос всю историю целиком, а сжимают старое в выжимку. Помогает и кэш: если начало запроса не изменилось с прошлого раза, DeepSeek считает его по отдельной, гораздо более низкой цене.

    Как это устроено у нас

    В ПРОфлирте токены тоже стоят денег, но считать их - наша забота, а не ваша. Монет за каждое сообщение нет, подписка с фиксированной ценой, есть бесплатный старт. Чтобы длинный разговор не рассыпался, персонаж держит имя и факты о вас в отдельной памяти, а не только в хвосте переписки. Поговорить можно с любым из персонажей каталога.

    Частые вопросы

    Сколько токенов в одном русском слове? По нашему замеру - около двух у современных токенизаторов (1,9 у GPT-4o, 2,1-2,2 у DeepSeek-V3) и около трёх у старого GPT-4. В английском - чуть больше одного.

    Токен - это буква? Нет. Чаще всего это кусок слова в несколько букв. Частое слово может быть одним токеном, редкое - пятью-шестью.

    Ответ модели тоже считается в токенах? Да. Ответ занимает место в том же окне, а платят за него по своему тарифу, обычно выше, чем за входящие.

    Почему разные нейросети считают одну фразу по-разному? У каждой свой словарь токенов. Поэтому сравнивать цены моделей «за токен» можно только приблизительно.

    Что такое контекстное окно простыми словами? Сколько текста помещается перед глазами модели одновременно - инструкции сервиса, переписка, ваша реплика плюс её собственный ответ. Всё, что не поместилось, для неё не существует.

    Если окно в миллион токенов, почему чат забывает начало разговора? Потому что сервис обычно не отправляет всю историю, а модель хуже замечает то, что лежит в середине длинного текста. Подробнее о том, как нейросеть устроена вообще, - в статье что такое нейросеть простыми словами.

    Хочешь попробовать? Выбери персонажа — девушки, парни, аниме и ролевые, общение бесплатно, прямо на сайте.

    Начать общение →