Вы написали запрос в ChatGPT, а ответ модели оборвался на полуслове. Или счет за API оказался втрое больше, чем планировали. Или лимит бесплатного чата закончился подозрительно быстро. Причина одна: токены. Это валюта, на которой работает каждый сервис искусственного интеллекта, и без понимания этой темы контролировать расходы на нейросети не получится.
Seopapa: сервис для продвижения сайтов в ТОП-1 Яндекс
Что такое токен в нейросети
Простыми словами, токен в нейросетях — минимальная единица текста, которую языковая модель способна обработать. Но вот ловушка: это не обязательно целое слово. Каждый токен может быть частью слова, отдельным словом, знаком препинания или даже парой символов. Всё зависит от того, насколько часто этот фрагмент встречается в данных, на которых проходило обучение модели.
Например, короткое русское слово «привет» — 2 токена в gpt-5.5, а «перевоплощение» модель разбивает на несколько частей: получается 5 фрагментов (и токенов), потому что слово длинное и сложное. Английское слово «hello» укладывается в один отдельный токен, а вот «unbelievable» разбивается на три. Правила тут не интуитивные — частотность решает больше, чем длина.
Думайте об этом как о мобильной связи. Раньше платили за минуты разговора, сейчас — за мегабайты трафика. С нейросетями та же история: платите за объем входных и выходных токенов. Написали запрос на 50 токенов, получили ответ на 200 — со счёта списали 250. Каждый пробел, каждая запятая, каждый символ в тексте — всё идет в зачет.
Как модель видит текст на самом деле
Нейросеть не читает буквы. Она работает с числами. Каждый токен получает числовой идентификатор — уникальный номер из словаря модели. Фраза «Напиши мне статью про блог» превращается в последовательность чисел. Модель обрабатывает именно эту последовательность числовых кодов, предсказывая следующий токен на каждом шаге генерации. Буквы и отдельные символы для неё — абстракция, а числа — рабочий материал.
Количество токенов в одном и том же предложении на русском языке и на английском будет разным. Кириллица часто занимает больше токенов, потому что модели OpenAI, DeepSeek и других компаний тренировались преимущественно на английском. На практике русский текст обходится примерно в полтора раза дороже — и это важно понимать при планировании расходов на любом проекте, где нужно использовать ИИ для генерации контента.
Не путайте с другими «токенами»
Слово «токен» встречается в совершенно разных контекстах, и путаница возникает часто. Токен в блокчейне — цифровой актив, единица стоимости на криптовалютной сети. Токен аутентификации — временный ключ, который сайт или приложение использует для проверки доступа (вопрос информационной безопасности и политики конфиденциальности). Токены в нейросетях — совсем другая история: это фрагменты текста для обработки языковыми моделями. В этой статье речь только о третьем — о тех кусочках данных, за которые вы платите, когда отправляете запрос в чат с ИИ или подключаете API к бизнес-системе.
Как нейросеть разбивает текст на токены
Разобравшись с тем, что такое токен как единица, перейдём к следующему вопросу: как именно модель разбивает текст на эти фрагменты? Процесс называется токенизацией, и работает он совсем не так, как деление по пробелам или слогам.
Алгоритм BPE: как нейросеть «нарезает» слова
Большинство языковых моделей используют алгоритм Byte Pair Encoding (BPE). Главная идея такая: во время обучения алгоритм анализирует огромный объём текстов и запоминает, какие комбинации символов встречаются часто. Часто встречающиеся слова попадают в словарь токенизатора целиком. Редкие слова дробятся на части — каждая часть слова становится отдельным токеном.
Например, слово «кот» в GPT-5.5 — один токен. Модель видела его тысячи раз при обучении, запомнила как целое слово. А вот «кошкообразный» она разобьёт на два-три фрагмента: «кош», «ко», «образ», «ный» или похожим образом. Каждый такой фрагмент получает свой номер в словаре, и дальше нейросеть обрабатывает именно эту последовательность токенов, а не буквы или слова.
Пробелы, знаки препинания, цифры — всё это тоже отдельные токены. Точка, запятая, восклицательный знак — каждый съедает лимит. Число вроде «100» может стать одним токеном, а длинных чисел вроде «8 495 123-45-67» (контакты, телефоны, коды) хватит на несколько.
Почему GPT и Claude считают по-разному
Разные модели используют разные токенизаторы с разными словарями. GPT, Claude, DeepSeek — у каждой своя политика разбиения. Одно и то же предложение на русском языке может дать 15 токенов в одной модели и 20 в другой. Это влияет на стоимость запроса и на то, сколько токенов контекстного окна вы расходуете на входных данных.
На практике это означает: если вы считаете расходы на API для бизнес-проекта, нельзя просто взять число токенов из одного сервиса и перенести на другой. Количество токенов зависит от конкретного токенизатора.
Код тоже «ест» токены
Отдельная история — программный код. Каждая скобка, оператор, отступ в коде становится токеном. Короткий фрагмент на Python из десяти строк легко превращается в 80–100 токенов. Фигурные скобки в JavaScript, точки с запятой в C++ — всё это информация для обработки, и модель тратит на нее ресурсы. При генерации больших блоков кода через чат или API счёт растёт быстрее, чем при работе с обычным текстом.
Чтобы проверить, сколько токенов в вашем запросе, можно перейти на сайт OpenAI в онлайн-инструмент для подсчета токенов. Вставьте свой промпт, текст статьи для блога или фрагмент кода и посмотрите, как именно текст разбивается на токены. Так станет понятно, где можно написать короче и сэкономить. Это первый шаг к тому, чтобы понимать и контролировать расходы, а не удивляться счетам.

Seopapa: сервис который выводит сайт в ТОП за 7 дней
Продвигаем сайты в топ выдачи Яндекс с помощью поведенческих факторов и уникальных технологий. Эффективен даже в сложных и перегретых нишах.
Сколько токенов в русском и английском тексте
Русский текст обходится дороже английского при работе с нейросетями, потому что токенизаторы языковых моделей проходили обучение преимущественно на данных английского языка. Словарь токенизатора содержит огромное количество английских слов целиком, а кириллица представлена хуже. Модель обрабатывает английское слово как один отдельный токен, а русское слово часто разбивает на два-три фрагмента.
Почему кириллица «тяжелее»
Возьмём простой пример. Фраза «The cat sat on the mat» в токенизаторе GPT-5.5 превращается в 6 токенов. Каждое английское слово остаётся целым. Теперь переведем: «Кот сидел на коврике». Казалось бы, слов даже меньше. Но на практике нейросеть получает 8 токенов, потому что «коврике» и «сидел» она разбивает на части. Слово «коврике» может стать последовательностью из «ков», «ри» и «ке». Вот почему за один и тот же смысл на русском языке платите в 1,5–2 раза больше токенов.
Длинные слова русского языка делают ситуацию еще хуже. «Достопримечательность» съедает 6 токенов. «Sightseeing» чаще укладывается в два. Каждый дополнительный токен входит в стоимость запроса через API, влияет на лимит контекстного окна и на объём ответа модели.
Ориентиры для подсчёта токенов
Простыми числами: 1 токен примерно равен четырем символам в английском тексте. В русском это около двух-трёх символов на токен. 100 токенов покрывают примерно 75 слов на английском, а на русском — около 40–50 слов. Информация важна для бизнеса: если компании генерируют контент для блога или чат-бота на русском, расходы на ИИ модели вырастут ощутимо.
Как считать токены для своих задач
Следующий шаг после понимания этих правил — научиться считать токены до отправки запроса. Для этого есть инструменты, которые позволяют вставить текст и увидеть, сколько токенов он содержит и где именно текст разбивается на части. Для разработчиков есть библиотека tiktoken на Python и аналоги для других языков. DeepSeek и другие современные модели используют собственные токенизаторы, и количество токенов в них может отличаться, но принцип тот же: кириллица почти всегда даёт больше токенов, чем латиница.
Раньше многие пользователи не задумывались об этой разнице. Но когда настройка приложения предполагает тысячи обращений в день, токен на каждом запросе складывается в ощутимую сумму. Понимать, сколько токенов «весит» текст на русском, — значит контролировать расходы и качество работы с нейросетями.
Контекстное окно и лимиты токенов в моделях 2026 года
Контролировать расходы на токены — полдела. Вторая часть — понимать, сколько токенов модель вообще способна обработать за один раз. Этот предел называется контекстным окном.
Что такое контекстное окно и как оно работает
Контекстное окно — максимальное количество токенов, которое модель обрабатывает в рамках одного запроса. Сюда входит всё: промпт, системная инструкция, история диалога и ответ модели. Простыми словами, это память нейросети на время разговора. Не долговременная, а оперативная: закончилось окно — информация из начала беседы исчезает.
На практике процесс выглядит так. Первое сообщение в чат занимает, например, 200 входных токенов. Ответ модели добавляет еще 400 выходных. Следующий запрос отправляет в нейросеть уже и новый вопрос, и всю предыдущую переписку. Каждый новый виток диалога делает «пакет» данных больше. Через несколько десятков сообщений лимит токенов исчерпывается, и модель начинает «забывать» то, что обсуждалось в начале, или обрезает ответ на полуслове.
Размеры окон в моделях 2026 года
Большие языковые модели сильно различаются по объёму контекста. Вот примерно где проходят границы к середине 2026 года:
Модель GPT-5.4 от OpenAI работают с окном в 1 миллион токенов и с 128 000 токенов на выходе.
Claude Opus 4.6 и Claude Sonnet 4 от Anthropic поддерживают окно в 1 миллион токенов, но только до 32 000 токенов на выходе. Для задач с длинными документами — контракты, исследования, книги — разница ощутимая.
Gemini 3.1 Pro от Google заявляет окно до миллиона токенов, а на выходе до 65 000.
Входные и выходные токены: почему стоимость разная
API-сервисы и тарифы разных компаний почти всегда устанавливают разные цены на входные и выходные токены. Генерация ответа требует больше вычислительных ресурсов, чем чтение запроса, поэтому выходные токены чаще стоят в два-три раза дороже. Когда бизнес-приложения отправляют тысячи запросов в день, эта разница определяет расходы. Считать нужно обе части: сколько токенов модель получает на входе и сколько генерирует на выходе.
Как не тратить токены впустую
Главная ловушка — разбухшая история диалога. Каждый следующий запрос пересылает всю последовательность предыдущих сообщений. Если тема разговора поменялась, лучше начать новый чат, а не продолжать старый. Настройка системного промпта тоже влияет: короткий и точный промпт экономит токены на каждом обращении. В проекте, где нейросеть обрабатывает контент или блог-статьи, имеет смысл разбивать длинный текст на фрагменты и отправлять их отдельными запросами, а не загружать всё разом. Такой шаг помогает и контролировать качество, и укладываться в ограничения модели.
Стоимость токенов у разных провайдеров и способы сократить расходы
Теперь разберёмся, сколько всё это стоит на практике. Провайдеры языковых моделей берут плату за 1 миллион токенов, причём цены входных и выходных токенов отличаются. Ответ модели обходится дороже, чем запрос к ней.
Цены в 2026 году: кто сколько берёт
Вот актуальные данные по основным ИИ моделям:
Разброс огромный. За одну и ту же задачу можно заплатить $0.40 или $25 за миллион токенов в зависимости от выбранной модели. ChatGPT, Claude и другие сервисы часто предлагают подписку, но у неё есть лимит на количество запросов. API работает иначе: платите ровно за тот объем токенов, который потратили.
Как экономить токены
Главная идея: не все задачи требуют больших и дорогих моделей. Для обработки шаблонных текстов, извлечения данных или работы чат бота подойдут модели попроще.
Несколько конкретных шагов, чтобы сократить расходы:
Пишите короткие промпты без лишних слов, знаков препинания и повторов. Каждый лишний символ — это отдельные токены, за которые платите.
Используйте системные инструкции вместо повтора правил в каждом запросе.
Не тащите историю предыдущих сообщений, если тема диалога сменилась.
Для генерации контента на блог настройка максимального числа выходных токенов помогает не переплачивать за «хвосты».
Стоимость запроса складывается из двух частей, и на обе можно влиять. В проекте с тысячами запросов экономия даже 200 токенов на каждом обращении за месяц превращается в ощутимую сумму.
Первого шага достаточно: откройте сайт токенизатора OpenAI, вставьте свой типичный промпт и посмотрите, сколько токенов он съедает.

Выводим сайты в ТОП-1 Яндекса
Продвигаем сайты в топ выдачи с помощью поведенческих факторов и уникальных технологий.
