Как работают токены в нейросетях: полное руководство для разработчиков и пользователей

Подробный разбор того, что такое токены в нейросетях, как работает токенизация, почему русский текст расходует больше токенов и как на этом экономить.

Что такое токен в контексте нейросетей

Токен — это минимальная единица текста, с которой работает языковая модель. В отличие от привычных нам слов или букв, токен может быть произвольным фрагментом: частью слова, целым словом, знаком препинания или даже пробелом. Размер и состав токена определяются словарём модели, который строится на этапе обучения.

Например, предложение «Коты не умеют писать код, у них лапки.» может быть разбито на 13 токенов: «К» + «оты» + «не» + «уме» + «ют» + «писать» + «код» + «,» + «у» + «них» + «лап» + «ки» + «.». Как видите, слово «писать» стало одним токеном, а «Коты» распалось на два. Это не случайность — токенизатор ищет в тексте наиболее часто встречающиеся комбинации символов, которые были зафиксированы в словаре.

Важно понимать: токен не является смысловой единицей. Он может не нести самостоятельного значения, но именно из таких «кирпичиков» модель собирает понимание языка. Размер словаря токенов у современных LLM обычно составляет от 30 000 до 100 000 единиц.

Как устроена токенизация: от текста к числам

Процесс превращения текста в понятные для нейросети данные проходит три этапа: токенизация, присвоение идентификаторов и преобразование в векторы.

Этап 1: Разбиение на токены. Когда вы отправляете запрос, модель сначала разбивает его на токены по своему внутреннему словарю. Этот словарь формируется задолго до обучения: разработчики берут огромный корпус текстов (терабайты данных) и с помощью специальных алгоритмов находят самые частые сочетания символов. Именно эти сочетания становятся токенами.

Этап 2: Превращение в числа. У каждого токена в словаре есть уникальный числовой идентификатор — token ID. Например, токен «К» может иметь ID 3682, «оты» — 41645, а «писать» — 171655. Таким образом, весь ваш запрос превращается в последовательность чисел.

Этап 3: Векторизация. Нейросеть не работает напрямую с числами-идентификаторами. Для каждого ID существует embedding — длинный список чисел (вектор), который описывает смысл и контекст токена. Например, ID 15432 может соответствовать вектору [0.12, -0.45, 0.88, 0.03, ...]. Именно с этими векторами и происходит основная работа: модель анализирует, какие токены стоят рядом, какие связи между ними существуют, и предсказывает следующий токен в последовательности.

Итоговая цепочка выглядит так: Текст → Токены → Token ID → Векторы → Вычисления в нейросети → Генерация ответа.

Алгоритмы токенизации: BPE, WordPiece и SentencePiece

Создание словаря токенов — нетривиальная задача. Для этого используются специальные алгоритмы субсловной токенизации (subword tokenization). Рассмотрим три самых популярных.

BPE (Byte-Pair Encoding). Алгоритм начинает с отдельных символов и на каждом шаге находит самую частую пару соседних токенов, объединяя их в один новый токен. Процесс повторяется до достижения нужного размера словаря. Например, если в тексте часто встречается сочетание «в» и «е», то на первом шаге появится токен «ве». Затем, если «ве» и «т» тоже часты, появится «вет». BPE используется в моделях GPT, Claude и многих других.

WordPiece. Похож на BPE, но объединяет пары не по частоте, а по тому, насколько сильно увеличится вероятность текста при добавлении этой пары. Этот алгоритм применяется в BERT.

SentencePiece. Это обёртка, которая может использовать BPE или Unigram LM. Её особенность в том, что она работает напрямую с «сырым» текстом, включая пробелы, что особенно удобно для языков без явного разделения слов пробелами (например, китайского или японского).

На практике BPE остаётся самым распространённым выбором благодаря своей эффективности и простоте. Он позволяет модели обрабатывать редкие и незнакомые слова, разбивая их на известные части.

Почему русский текст расходует больше токенов, чем английский

Это один из самых частых вопросов при работе с нейросетями. Разница может достигать 1,5–3 раз в пользу английского языка. Причин несколько.

Данные для обучения. Большинство современных LLM разрабатывались в США, и основная часть обучающих текстов была на английском. Словари токенов оптимизированы под латиницу: частые английские слова и сочетания хранятся целиком, а для кириллицы таких заготовок значительно меньше.

Кодировка. Токенизаторы работают на уровне байтов. В UTF-8 один латинский символ занимает 1 байт, а один кириллический — 2 байта. Это означает, что русская буква изначально «тяжелее» английской. Например, слово «кот» весит 6 байт, а «cat» — только 3.

Богатство словоформ. В русском языке одно слово может иметь десятки форм: «кот», «кота», «котов», «котам», «котами» и так далее. В английском таких вариантов обычно 2–4. Токенизатору приходится обрабатывать больше вариантов, что приводит к более дробному разбиению.

Практический вывод: если вы работаете через API и платите за каждый токен, общение на английском может быть в 2–3 раза дешевле. Для русскоязычных проектов стоит закладывать запас в 15–20% при расчёте бюджета.

Контекстное окно: что это и как оно влияет на работу

Контекстное окно — это максимальное количество токенов, которое модель может обработать за один запрос. В него входят: ваш промпт, системные инструкции, история диалога, загруженные файлы и ответ модели.

Размер окна сильно варьируется между моделями. Например, у Grok 4.1 Fast он достигает 2 000 000 токенов, у GPT-4.1 — 1 000 000, а у DeepSeek V3.2 — 128 000. Для сравнения: 128 000 токенов — это примерно 200 страниц английского текста или книга среднего размера. Миллион токенов покрывает около 1500 страниц или 50 000 строк кода.

Важное ограничение: большое окно не гарантирует идеальной обработки всего содержимого. Исследования показывают, что модели лучше всего работают с информацией в начале и в конце контекста, а данные в середине длинного текста могут «теряться». Поэтому при работе с большими документами самую важную информацию стоит размещать в начале или в конце промпта.

Когда контекстное окно заполняется, модель начинает «забывать» ранние части разговора. Это особенно заметно в длинных диалогах: нейросеть перестаёт учитывать то, что обсуждалось в начале беседы.

Типы токенов: input, output, cached и reasoning

Токены различаются не только составом символов, но и ролью в процессе обработки. Выделяют четыре основных типа.

Input tokens (входящие токены). Всё, что вы отправляете модели: промпты, историю переписки, прикреплённые документы, системные инструкции. Это весь входящий контекст до начала генерации ответа.

Output tokens (исходящие токены). Токены, которые модель использует для формирования ответа. Обычно они стоят дороже входных, потому что генерация нового текста требует значительно больше вычислений, чем чтение входных данных.

Cached tokens (кэшированные токены). Это тоже входящие токены, но модель может использовать их повторно благодаря кэшированию. Например, если вы часто используете один и тот же системный промпт, его токены могут быть закэшированы, и вы заплатите за них меньше. У разных провайдеров скидка на кэш составляет от 50% до 90%.

Reasoning tokens (токены рассуждения). Некоторые модели (например, ChatGPT o1, Gemini с расширенными рассуждениями) перед ответом выстраивают внутреннюю цепочку рассуждений. Эти токены не видны пользователю, но расходуются на «размышления» модели. Они могут значительно увеличивать общий расход, особенно на сложных задачах.

Как считать токены: инструменты и методы

Точный подсчёт токенов необходим при работе через API, где каждый токен стоит денег. На глаз определить количество токенов невозможно, поэтому используются специальные инструменты.

OpenAI Tokenizer. Бесплатный онлайн-инструмент, который показывает, как текст разбивается на токены, и подсвечивает каждый из них отдельным цветом. Позволяет быстро оценить расход для любого текста.

Price Per Token. Сервис, поддерживающий более 300 моделей от разных провайдеров. Он не только считает токены, но и сразу показывает стоимость запроса. Удобен для сравнения расходов на одну и ту же задачу в разных моделях.

API-методы провайдеров. Многие компании предоставляют специальные эндпоинты для подсчёта токенов без генерации ответа. Например, у Claude есть метод messages/count_tokens, который возвращает количество входных токенов в запросе. Это позволяет заранее оценить расход, не тратя деньги на полный запрос.

Грубая оценка. Для приблизительных расчётов можно использовать следующие ориентиры: 1 токен ≈ 4 символа латиницы или 2 символа кириллицы; 1 токен ≈ 3/4 английского слова; 100 токенов ≈ 75 английских слов; 1 страница А4 на русском ≈ 1000–1250 токенов. Но помните: эти цифры очень примерные и сильно зависят от языка и конкретной модели.

Сколько стоят токены и как экономить

Стоимость токенов сильно различается между моделями и провайдерами. Цены обычно указываются за 1 миллион токенов. Входные токены (ваш запрос) всегда дешевле выходных (ответ модели).

На начало 2026 года примерные цены выглядят так: Claude Opus 4.6 — $5 за миллион входных и $25 за миллион выходных токенов; GPT-5.2 — $1,75 и $14 соответственно; Gemini 3 Flash — $0,50 и $3; DeepSeek V3.2 — $0,28 и $0,42. Разница между самой дорогой и самой дешёвой моделью может достигать 50–100 раз.

Как экономить:

  • Пишите конкретные промпты. Вместо «Пожалуйста, предоставьте мне подробный анализ» напишите «Проанализируйте документ». Экономия 8–10 токенов на каждом запросе в масштабе тысяч запросов даёт ощутимую сумму.
  • Выбирайте подходящую модель. Для простых задач (форматирование, ответы на типовые вопросы) не нужна топовая модель. Claude Haiku или GPT-4o-mini стоят в десятки раз дешевле и справляются не хуже.
  • Структурируйте промпты. Используйте Markdown-разделители или XML-теги. Это помогает модели быстрее извлечь нужную информацию и сокращает количество токенов в ответе.
  • Кэшируйте повторяющиеся части. Если вы часто используете один и тот же системный промпт, кэширование может дать скидку 50–90% на эти токены.

Токены в изображениях, аудио и видео

Современные мультимодальные модели работают не только с текстом. Изображения, аудио и видео тоже переводятся в токены, но по другим правилам.

Изображения. У каждого провайдера своя формула. Claude считает токены как (ширина × высота) / 750. Стандартное изображение занимает около 1600 токенов. GPT оценивает картинку 1024×1024 примерно в 765 токенов. Gemini — от 258 до 1290 токенов в зависимости от разрешения.

Видео. Модель раскладывает видео на отдельные кадры и аудиодорожку. Каждый кадр считается как отдельное изображение. Минутное видео может весить десятки тысяч токенов.

Аудио. Токенизация аудио зависит от длительности и качества записи. Обычно одна минута речи занимает несколько тысяч токенов.

При работе с мультимедийным контентом через API стоит заранее оценивать расход токенов, так как он может быть значительно выше, чем при работе только с текстом.

Вопросы и ответы

Чем токен в нейросети отличается от токена в криптовалюте?

Это совершенно разные понятия. В контексте нейросетей токен — это фрагмент текста (часть слова, символ или знак препинания), с которым работает языковая модель. Токен в криптовалюте — это цифровой актив, единица учёта в блокчейне. Их объединяет только название.

Почему одно и то же предложение на русском и английском расходует разное количество токенов?

Основных причин три. Во-первых, модели обучались преимущественно на английских текстах, поэтому их словари лучше оптимизированы под латиницу. Во-вторых, кириллические символы в UTF-8 занимают 2 байта, а латинские — 1 байт. В-третьих, русский язык богаче словоформами, что приводит к более дробному разбиению. В среднем русский текст расходует в 1,5–3 раза больше токенов.

Как узнать, сколько токенов займёт мой текст перед отправкой запроса?

Используйте онлайн-токенизаторы, например OpenAI Tokenizer. Он покажет разбивку текста на токены и их количество. Также многие провайдеры (Anthropic, OpenAI) предоставляют API-методы для подсчёта токенов без генерации ответа. Это позволяет заранее оценить расход.

Что такое контекстное окно и почему оно важно?

Контекстное окно — это максимальное количество токенов, которое модель может обработать за один запрос. В него входят ваш промпт, история диалога, загруженные файлы и ответ модели. Когда окно заполняется, модель начинает «забывать» ранние части разговора. Размер окна варьируется от 128 000 токенов (DeepSeek) до 2 000 000 (Grok).

Как можно сократить расход токенов при работе через API?

Используйте короткие и конкретные промпты, выбирайте более дешёвые модели для простых задач, структурируйте запросы с помощью Markdown или XML, а также применяйте кэширование повторяющихся частей промпта. Кэширование может дать скидку до 90% на одинаковые токены.

Сколько токенов занимает изображение при обработке нейросетью?

Это зависит от провайдера. Например, Claude рассчитывает токены как (ширина × высота) / 750 — стандартное изображение занимает около 1600 токенов. GPT оценивает картинку 1024×1024 в 765 токенов. Gemini — от 258 до 1290 токенов в зависимости от разрешения.

Почему выходные токены стоят дороже входных?

Генерация нового текста требует от модели значительно больше вычислительных ресурсов, чем чтение и анализ входных данных. Модель должна последовательно предсказывать каждый следующий токен, что включает сложные математические операции на каждом шаге. Поэтому провайдеры устанавливают более высокую цену на выходные токены.