Что такое токены в нейросети: почему русский дороже английского и куда девается длинный разговор

Коротко. Токен - кусок текста, которым считает нейросеть: целое слово, часть слова или знак препинания. В токенах модель читает, пишет, помнит и выставляет счёт. Мы проверили на своих текстах: русское слово в среднем занимает около двух токенов, английское - чуть больше одного. Контекстное окно - сколько токенов модель видит за один раз; всё, что в него не попало, для неё не существует. А длинный разговор дорожает с каждой репликой, потому что модель каждый раз перечитывает его целиком.
Как текст превращается в токены

Модель не видит букв и слов. Перед тем как текст попадёт внутрь, специальная программа - токенизатор - режет его на куски из своего словаря и заменяет каждый кусок номером. С номерами модель и работает.
Словарь собирают заранее из огромного количества текстов: частые сочетания букв становятся отдельными токенами, редкие собираются из нескольких. Вот как режет фразы токенизатор GPT-4o (мы проверили через открытую библиотеку tiktoken 8 октября 2026 года):
- «Привет, как дела?» →
Привет,какдела?- шесть токенов; - «нейросеть» →
нейросеть- три; - «Здравствуйте» - один токен целиком, слово встречалось достаточно часто.
У другой модели словарь другой, и счёт тоже. Токенизатор DeepSeek-V3 (он опубликован вместе с моделью) режет «Здравствуйте» на пять кусков, а «Я тебя люблю» - на пять вместо трёх у GPT-4o. Словарь у GPT-4o около 200 тысяч токенов, у DeepSeek-V3 около 128 тысяч.
Отсюда первое практическое следствие: «сколько токенов в слове» зависит от модели, и одна и та же фраза у разных нейросетей стоит по-разному.
Почему русский текст «тяжелее» английского
Мы взяли нашу статью про память персонажа (около 900 слов) и подборку первых реплик наших персонажей, прогнали через три токенизатора и сравнили с английским текстом похожего стиля.
| токенизатор | русский, токенов на слово | английский, токенов на слово |
|---|---|---|
| GPT-4 (cl100k_base) | 3,1 | 1,1 |
| GPT-4o (o200k_base) | 1,9 | 1,1 |
| DeepSeek-V3 | 2,1-2,2 | 1,1 |
Замер наш, 8 октября 2026, на небольшом объёме текста - это порядок величины, а не константа. Но порядок говорит о многом: одна и та же мысль по-русски занимает почти вдвое больше токенов. У старого токенизатора GPT-4 разница была почти втрое; в новых словарях русских кусков больше, и разрыв сократился.
Причин две. Словари строят на текстах, где английского обычно больше, поэтому английские слова чаще попадают туда целиком. И у русского богаче формы слова: «дом», «дома», «домом», «домами» - для токенизатора это разные последовательности, и каждую приходится собирать.
Для пользователя это значит две вещи: в то же окно помещается меньше русского текста, а при оплате за токены русский разговор обходится дороже.
Промт, контекст и окно: что модель видит на самом деле
Промт - это текст запроса к модели (как его составить, разобрано в статье как написать промт). Когда вы отправляете сообщение в чат, модель получает не только его. В запрос собирается всё сразу:
- инструкции сервиса (как отвечать, чего не делать);
- описание персонажа или роли;
- то, что сервис сохранил о вас в памяти;
- история разговора;
- ваше новое сообщение.
Всё это вместе и есть промт в широком смысле - полный текст, на который модель отвечает. А контекстное окно - предел этого текста в токенах. Ответ модели тоже считается в токенах и тоже ограничен.
Окна у современных моделей большие. Например, у моделей DeepSeek в API, по официальной странице на 8 октября 2026 года, - 1 миллион токенов. По нашему замеру токенизатора DeepSeek-V3 это порядка 470 тысяч русских слов. Как правильно составить сам запрос, мы разбирали в шаблонах промтов для ролевой игры.
Почему персонаж «забывает» длинный разговор

Если окно такое большое, откуда забывчивость? Причин три, и до предела окна обычно дело не доходит.
Сервис сам обрезает историю. Отправлять модели весь разговор за месяц на каждую реплику - долго и дорого (почему дорого - ниже). Поэтому в запрос попадает хвост последних сообщений и сжатая выжимка остального. Что не попало в выжимку, для модели исчезло.
Середина теряется. Даже то, что в окно попало, модель использует неравномерно. В исследовании «Lost in the Middle» (исследователи Стэнфорда и соавторы, опубликовано в журнале TACL в 2024 году) модели лучше находили нужный факт, когда он стоял в начале или в конце длинного текста, и заметно хуже - когда в середине. Большое окно - ещё не внимательное чтение.
Выжимка огрубляет. Пересказ тысячи сообщений в двух абзацах неизбежно теряет детали: общая линия остаётся, точная фраза - не всегда.
Что с этим делать в любом чате:
- важное повторяйте ближе к концу, а не надейтесь, что модель найдёт его в середине;
- в длинном рабочем диалоге просите время от времени: «перечисли, о чём мы договорились» - и поправляйте ошибки сразу;
- новую тему начинайте в новом чате: старый разговор занимает окно и отвлекает модель.
Как память устроена у ИИ-персонажей - извлечённые факты, поиск по прошлым разговорам и пересказ отношений - рассказано в отдельной статье про память ИИ-персонажа.
Сколько стоят токены
Компании, которые подключают нейросети через API, платят за каждый токен: отдельно за прочитанные (входящие) и за написанные (исходящие). Цены на официальных страницах на 8 октября 2026 года:
| модель | за что | цена |
|---|---|---|
| DeepSeek, flash | 1 млн входящих токенов (вне пиковых часов) | $0,15 |
| DeepSeek, flash | 1 млн исходящих токенов (вне пиковых часов) | $0,60 |
| YandexGPT Pro 5.1 | 1 000 токенов, входящие и исходящие | 0,80 ₽ |
| Alice AI LLM Flash | 1 000 входящих / исходящих токенов | 0,10 ₽ / 0,20 ₽ |
Источники: DeepSeek API, Yandex AI Studio (синхронный режим, с НДС). В пиковые часы DeepSeek берёт вдвое больше.
Теперь главное: почему длинный разговор дорожает. Возьмём вечер переписки - 100 ваших сообщений и 100 ответов, по 40 слов каждое. В токенах DeepSeek-V3 это примерно 85 токенов на сообщение, а весь вечер - около 17 тысяч токенов текста.
Но модель на каждом ходу перечитывает всю историю. Для первого ответа - почти пустую, для сотого - все 17 тысяч. Если сложить, за вечер модель прочитает около 850 тысяч токенов при 17 тысячах написанных. В пятьдесят раз больше. И это без инструкций и описания персонажа, которые тоже едут в каждом запросе.
По ценам из таблицы такие 850 тысяч входящих токенов стоят около 13 центов у DeepSeek flash и около 680 рублей у YandexGPT Pro 5.1. Сравнение грубое: у каждой модели свой токенизатор, и тот же текст в её счёте может занять другое число токенов. Зато видно, почему сервисы не тащат в запрос всю историю целиком, а сжимают старое в выжимку. Помогает и кэш: если начало запроса не изменилось с прошлого раза, DeepSeek считает его по отдельной, гораздо более низкой цене.
Как это устроено у нас
В ПРОфлирте токены тоже стоят денег, но считать их - наша забота, а не ваша. Монет за каждое сообщение нет, подписка с фиксированной ценой, есть бесплатный старт. Чтобы длинный разговор не рассыпался, персонаж держит имя и факты о вас в отдельной памяти, а не только в хвосте переписки. Поговорить можно с любым из персонажей каталога.
Частые вопросы
Сколько токенов в одном русском слове? По нашему замеру - около двух у современных токенизаторов (1,9 у GPT-4o, 2,1-2,2 у DeepSeek-V3) и около трёх у старого GPT-4. В английском - чуть больше одного.
Токен - это буква? Нет. Чаще всего это кусок слова в несколько букв. Частое слово может быть одним токеном, редкое - пятью-шестью.
Ответ модели тоже считается в токенах? Да. Ответ занимает место в том же окне, а платят за него по своему тарифу, обычно выше, чем за входящие.
Почему разные нейросети считают одну фразу по-разному? У каждой свой словарь токенов. Поэтому сравнивать цены моделей «за токен» можно только приблизительно.
Что такое контекстное окно простыми словами? Сколько текста помещается перед глазами модели одновременно - инструкции сервиса, переписка, ваша реплика плюс её собственный ответ. Всё, что не поместилось, для неё не существует.
Если окно в миллион токенов, почему чат забывает начало разговора? Потому что сервис обычно не отправляет всю историю, а модель хуже замечает то, что лежит в середине длинного текста. Подробнее о том, как нейросеть устроена вообще, - в статье что такое нейросеть простыми словами.
Хочешь попробовать? Выбери персонажа — девушки, парни, аниме и ролевые, общение бесплатно, прямо на сайте.
Начать общение →