Счётчик токенов ИИ и вместимость контекста
Вставьте любой текст, чтобы увидеть, во сколько токенов он, скорее всего, превратится, влезет ли в заданное контекстное окно и сколько будет стоить по вашим тарифам API. Всё работает в браузере — текст никуда не загружается.
Влезет ли это в контекстное окно?
| Контекстное окно | Ваш текст | Влезет? |
|---|
Контекстное окно делят между собой ваш ввод, ответ модели и всё, что приложение добавляет за кадром (системный промпт, найденные документы, история чата). Оставляйте запас — заполнить окно до краёв и значит получить обрезанный ответ.
Сколько это будет стоить?
Как работает эта оценка (и почему она неточна)
Настоящая токенизация прогоняет по вашему тексту BPE-словарь конкретной модели — а у каждого семейства он свой, поэтому «истинное» число у моделей разное. Сделать это как следует в браузере значит тянуть по многомегабайтному словарю на семейство, что замедлило бы эту страницу ради числа, которое нужно вам лишь примерно.
Вместо этого используется оценка по символам и словам, с весами для пробелов, пунктуации и цифр; для обычной английской прозы она укладывается примерно в 10–15%. Два известных перекоса: код и текст с обилием знаков препинания токенизируются плотнее, чем подсказывает оценка, а нелатинские письменности (китайская, японская, арабская, хинди) расходуют заметно больше токенов на символ, чем английский, — часто в 2–3 раза.
Если точность нужна для биллинга, обращайтесь к токенайзеру самого провайдера. А для вопросов «влезет ли» и «сколько примерно выйдет» правильный инструмент — оценка.
Что такое токен на самом деле
Модели читают не символы и не слова, а токены — куски где-то между тем и другим. Обычные слова — как правило, один токен; длинные или редкие распадаются на несколько. «Unbelievable» может быть тремя токенами, «the» — одним. В английской прозе один токен в среднем около четырёх символов, то есть примерно три четверти слова.
Всё считается и ограничивается в токенах: что вы отправляете, что приходит в ответ и сколько модель может удержать за раз.
Почему ваш текст плотнее, чем вам кажется
- Код токенизируется плохо — отступы, скобки и camelCase стоят токенов. Файл на 500 строк может весить куда больше, чем подсказывает число символов.
- Текст не на английском обходится дорого. Языки без латиницы часто стоят в 2–3 раза больше токенов на символ, поэтому один и тот же промпт на японском может обойтись в несколько раз дороже, чем на английском.
- Повторы дёшевы, структура — нет. Обвязка из JSON и Markdown быстро накапливается на множестве вызовов.
Контекстное окно ≠ ваш бюджет
Окно на миллион токенов не значит, что нужно слать миллион токенов. У очень длинных входов качество внимания проседает к середине, задержка растёт, а стоимость увеличивается линейно. Поиск по документам — вытащить только нужные фрагменты — обычно выигрывает у набивания окна, да ещё и дешевле.
Часто задаваемые вопросы
Насколько точен этот счётчик?
Примерно в пределах 10–15% для обычной английской прозы. Код и нелатинские письменности выходят выше оценки. Для точных сумм в счёте используйте токенайзер своего провайдера.
Мой текст куда-нибудь загружается?
Нет. Расчёт идёт в вашем браузере. Ни запроса, ни логов, ни хранения.
Почему вы не показываете цены моделей?
Потому что они меняются, а уверенно показанная устаревшая цена хуже, чем никакой. Введите актуальные тарифы вашего провайдера — арифметику сделает инструмент.
Расходуют ли токены изображения и аудио?
Да — мультимодальные входы тоже переводятся в токены, по ставкам, которые зависят от провайдера и разрешения. Этот инструмент работает только с текстом.
Похожее: Что такое RAG? · Какая модель ИИ под какую задачу · Все бесплатные инструменты