Penghitung token AI dan kecocokan konteks
Tempel teks apa pun untuk melihat berapa token yang kemungkinan dihasilkan, apakah muat di jendela konteks tertentu, dan berapa biayanya dengan tarif API Anda sendiri. Semuanya berjalan di peramban Anda — teksnya tidak pernah diunggah.
Apakah muat di jendela konteks?
| Jendela konteks | Teks Anda | Muat? |
|---|
Jendela konteks dibagi antara masukan Anda, balasan model, dan apa pun yang ditambahkan aplikasi di balik layar (prompt sistem, dokumen hasil pencarian, riwayat obrolan). Sisakan ruang — mengisi jendela sampai penuh itulah yang membuat jawaban terpotong.
Berapa biayanya?
Cara kerja penaksiran ini (dan kenapa tidak persis)
Tokenisasi sungguhan menjalankan kosakata BPE khas tiap model pada teks Anda — dan setiap keluarga model memakai kosakata yang berbeda, sehingga hitungan «sebenarnya» berbeda per model. Melakukannya dengan benar di peramban berarti mengirim kosakata berukuran beberapa megabita per keluarga, yang akan membuat halaman ini lambat demi angka yang hanya Anda butuhkan secara kasar.
Sebagai gantinya, alat ini memakai penaksir berbasis karakter dan kata, dengan bobot untuk spasi, tanda baca, dan angka, yang meleset sekitar 10–15% untuk prosa Inggris biasa. Dua bias yang diketahui: kode dan teks bertanda baca padat ter-tokenisasi lebih rapat daripada yang ditaksir, dan aksara non-Latin (Mandarin, Jepang, Arab, Hindi) memakai jauh lebih banyak token per karakter dibanding Inggris — sering 2–3 kali.
Kalau Anda butuh angka pasti untuk penagihan, pakai endpoint tokenizer milik penyedia Anda. Untuk «apakah ini muat» dan «kira-kira berapa biayanya», penaksiran adalah alat yang tepat.
Apa sebenarnya token itu
Model tidak membaca karakter ataupun kata — mereka membaca token, potongan yang ada di antara keduanya. Kata umum biasanya satu token; kata yang lebih panjang atau tak lazim terpecah jadi beberapa. «Unbelievable» bisa tiga token, «the» satu. Dalam prosa Inggris, satu token rata-rata sekitar empat karakter, atau kira-kira tiga perempat kata.
Semuanya dihargai dan dibatasi dalam token: yang Anda kirim, yang kembali, dan seberapa banyak yang bisa ditampung model sekaligus.
Kenapa teks Anda lebih padat dari yang Anda kira
- Kode ter-tokenisasi dengan buruk — indentasi, kurung, dan camelCase semuanya memakan token. Berkas 500 baris bisa jauh lebih besar daripada yang disiratkan jumlah karakternya.
- Teks non-Inggris itu mahal. Bahasa yang tidak memakai aksara Latin sering memakan 2–3 kali lebih banyak token per karakter, itulah sebabnya prompt yang sama bisa berkali-kali lebih mahal dalam bahasa Jepang daripada Inggris.
- Pengulangan itu murah, struktur tidak. Kerangka JSON dan Markdown cepat menumpuk di banyak panggilan.
Jendela konteks ≠ anggaran Anda
Jendela satu juta token bukan berarti Anda harus mengirim satu juta token. Kualitas atensi menurun ke arah tengah masukan yang sangat panjang, latensi naik, dan biaya bertambah secara linear. Retrieval — mengambil hanya bagian yang relevan — biasanya mengalahkan menjejali jendela, dan lebih murah.
Pertanyaan Umum
Seberapa akurat penghitung ini?
Sekitar 10–15% untuk prosa Inggris biasa. Kode dan aksara non-Latin condong lebih tinggi dari taksiran. Untuk angka penagihan yang pasti, gunakan tokenizer penyedia Anda.
Apakah teks saya diunggah ke mana pun?
Tidak. Perhitungannya berjalan di peramban Anda. Tidak ada permintaan, tidak ada pencatatan, tidak ada penyimpanan.
Kenapa harga model tidak ditampilkan?
Karena harganya berubah, dan menampilkan harga basi dengan percaya diri lebih buruk daripada tidak menampilkan harga. Masukkan tarif terkini penyedia Anda, dan perkakas ini yang menghitung.
Apakah gambar dan audio memakai token?
Ya — masukan multimodal juga diubah menjadi token, dengan laju yang berbeda-beda menurut penyedia dan resolusi. Perkakas ini hanya mencakup teks.
Terkait: Apa itu RAG? · Model AI mana untuk tugas apa · Semua perkakas gratis