Счётчик токенов ИИ и вместимость контекста
Вставьте любой текст, чтобы увидеть, во сколько токенов он, скорее всего, превратится, влезет ли в заданное контекстное окно и сколько будет стоить по вашим тарифам API. Всё работает в браузере — текст никуда не загружается.
Влезет ли это в контекстное окно?
| Контекстное окно | Ваш текст | Влезет? |
|---|
Контекстное окно делят между собой ваш ввод, ответ модели и всё, что приложение добавляет за кадром (системный промпт, найденные документы, история чата). Оставляйте запас: заполните окно до краёв — и ответ обрежется.
Сколько это будет стоить?
Стоимость ввода считается по тексту, вставленному выше, — вставьте что-нибудь, чтобы её посчитать.
Как работает эта оценка (и почему она неточна)
Настоящая токенизация прогоняет по вашему тексту BPE-словарь конкретной модели — а у каждого семейства он свой, поэтому «истинное» число у моделей разное. Сделать это как следует в браузере — значит тянуть по многомегабайтному словарю на каждое семейство, что замедлило бы страницу ради числа, которое нужно вам лишь примерно.
Вместо этого используется оценка по символам и словам, с весами для пробелов, пунктуации и цифр; на обычной английской прозе её погрешность — примерно 10–15%. Два известных перекоса: код и текст с обилием знаков препинания токенизируются плотнее, чем показывает оценка, а языки с нелатинской письменностью (китайский, японский, арабский, хинди) расходуют заметно больше токенов на символ, чем английский, — часто в 2–3 раза.
Если точность нужна для биллинга, обращайтесь к токенайзеру самого провайдера. А для вопросов «влезет ли» и «сколько примерно выйдет» правильный инструмент — оценка.
Что такое токен на самом деле
Модели читают не символы и не слова, а токены — куски где-то между тем и другим. Обычные слова — как правило, один токен; длинные или редкие распадаются на несколько. «Unbelievable» может быть тремя токенами, «the» — одним. В английской прозе один токен в среднем около четырёх символов, то есть примерно три четверти слова.
И цена, и лимиты — всё в токенах: что вы отправляете, что приходит в ответ и сколько модель может удержать за раз.
Почему ваш текст плотнее, чем вам кажется
- Код токенизируется плохо — отступы, скобки и camelCase стоят токенов. Файл на 500 строк может весить куда больше, чем подсказывает число символов.
- Текст не на английском обходится дорого. Языки без латиницы часто стоят в 2–3 раза больше токенов на символ, поэтому один и тот же промпт на японском может обойтись в несколько раз дороже, чем на английском.
- Повторы дёшевы, структура — нет. Обвязка из JSON и Markdown быстро накапливается на множестве вызовов.
Контекстное окно ≠ ваш бюджет
Окно на миллион токенов не значит, что туда нужно отправлять миллион токенов. На очень длинных входах внимание модели хуже работает в середине, задержка растёт, а стоимость увеличивается линейно. Поиск по документам — когда из них берут только нужные фрагменты — обычно работает лучше набитого под завязку окна и обходится дешевле.
Часто задаваемые вопросы
Насколько точен этот счётчик?
Примерно в пределах 10–15% для обычной английской прозы. У кода и текстов не на латинице реальное число токенов выше оценки. Для точных сумм в счёте используйте токенизатор своего провайдера.
Мой текст куда-нибудь загружается?
Нет. Расчёт идёт в вашем браузере. Ни запроса, ни логов, ни хранения.
Почему вы не показываете цены моделей?
Потому что они меняются, а устаревшая цена, показанная уверенно, хуже, чем её отсутствие. Введите актуальные тарифы вашего провайдера — арифметику сделает инструмент.
Расходуют ли токены изображения и аудио?
Да — мультимодальный ввод тоже переводится в токены, а сколько их получится, зависит от провайдера и разрешения. Этот инструмент работает только с текстом.
Похожее: Что такое RAG? · Какая модель ИИ под какую задачу · Все бесплатные инструменты