What is ChatGPT Token Counter?
▾
A ChatGPT Token Counter megbecsüli a tokenek számát egy adott szövegben, és kiszámítja a kapcsolódó API költséget az OpenAI modellekhez, beleértve a GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo és más LLM-eket. A tokenek a szövegfeldolgozás alapvető egységei a nagy nyelvi modellekben – nem karakterek vagy szavak, hanem részszóegységek, amelyek átlagosan körülbelül 4 karakterből vagy 0,75 szóból állnak tokenenként angolul. A jogkivonatok számának megértése elengedhetetlen az API-költségek kezeléséhez, a gyors tervezéshez és a modellkontextus-ablak korlátainak betartásához. A GPT-4o támogatja a 128 000 token kontextusablakot, ami azt jelenti, hogy egyetlen beszélgetés nagyjából 96 000 szavas kombinált bemenetet és kimenetet tartalmazhat. Mivel az API-számlázás a tokenszámon alapul, a bemeneti és kimeneti tokenek külön díjszabásával, a pontos tokenbecslés közvetlenül befolyásolja a fejlesztési költségvetést és az alkalmazás költségeit.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Képlet
▾
Token Count (hozzávetőleges) = karakterszám / 4 vagy szószám / 0,75. API költség = (bemeneti tokenek / 1 000 000) x milliónkénti bemeneti ár + (kimeneti tokenek / 1 000 000) x milliónkénti kimeneti ár.Variable Legend
▾
| Szimbólum | Név | Egység | Leírás |
|---|---|---|---|
| T | Token Count | tokens | A tokenek száma a bemeneti vagy kimeneti szövegben, a modell tokenizátora által meghatározottak szerint (pl. cl100k_base a GPT-4 esetén) |
| C | Karakterszám | characters | A szöveg teljes karakterszáma – nagyjából 4 karakter tokenenként angolul |
| Pi | Bemeneti ár | USD per 1M tokens | Egymillió bemeneti (prompt) tokenenkénti költség a kiválasztott modellhez |
| Po | Kimeneti ár | USD per 1M tokens | A kiválasztott modellhez tartozó millió kimeneti (befejezési) tokenenkénti költség – jellemzően 2-4-szer magasabb, mint a bemeneti ár |
| W | Kontextus ablak | tokens | Maximális kombinált bemeneti és kimeneti tokenek, amelyeket a modell egyetlen kérésben támogat |
How to ChatGPT Token Counter
▾
- 1Illessze be vagy írja be a szöveget a tokenszámláló beviteli mezőjébe – az eszköz valós időben dolgozza fel azt.
- 2A számláló a tokenenkénti ~4 karakter közelítésével becsüli meg a tokenek számát (vagy a tényleges cl100k_base tokenizert használja a pontos számláláshoz).
- 3Válassza ki a használni kívánt AI-modellt – GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo, Claude 3 stb. – mivel az árak jelentősen eltérnek.
- 4A számológép a modell milliónkénti árat alkalmazza a bemeneti tokenszámra és a becsült kimeneti tokenszámra.
- 5A teljes API költség kiszámítása: (bemeneti tokenek x beviteli sebesség) + (kimeneti tokenek x kimeneti sebesség).
- 6Az eszköz azt is megmutatja, hogy a prompt a modell kontextusablakából mennyit fogyaszt, így segít a korlátokon belül maradni.
- 7Kötegelt műveletek esetén a projekt teljes költségének becsléséhez szorozza meg a kérésenkénti költséget az API-hívások számával.
Worked Examples
▾
200 szó / 0,75 = ~267 token bevitel. GPT-4o árfolyamon (2,50 USD/1 millió bemenet, 10,00 USD/1 millió kimenet): bemeneti költség = 267/1 millió x 2,50 USD = 0,00067 USD, kimeneti költség = 267/1 millió x 10,00 USD = 0,00267 USD. Kérelemenként összesen = 0,00334 USD. Havi 10 000 ügyfél-interakció esetén a teljes költség körülbelül 33,40 USD.
10 000 szó / 0,75 = ~13 333 beviteli token. 500 szó / 0,75 = ~667 kimeneti token. Beviteli költség: 13 333/1 millió x 2,50 USD = 0,0333 USD. Kimeneti költség: 667/1M x 10,00 USD = 0,00667 USD. Összesen = ~0,04 USD dokumentumonként. 1000 dokumentum összegzése körülbelül 40 dollárba kerülne.
GPT-3.5 Turbo: (1000/1M x 0,50 USD) + (500/1M x 1,50 USD) = 0,0005 USD + 0,00075 USD = 0,00125 USD. GPT-4o: (1000/1M x 2,50 USD) + (500/1M x 10,00 USD) = 0,0025 USD + 0,005 USD = 0,0075 USD. A GPT-4o kérésenként hatszor drágább, de lényegesen jobb érvelési és utasításkövetési minőséget biztosít.
Napi beviteli tokenek: 500 x 100 000 = 50 millió. Napi kimeneti tokenek: 300 x 100 000 = 30 millió. Beviteli költség: 50 millió/1 millió x 0,15 USD = 7,50 USD. Kimeneti költség: 30 millió/1 millió x 0,60 USD = 18,00 USD. Napi végösszeg = 25,50 USD, havi = ~ 765 USD. A GPT-4o minit olyan nagy volumenű alkalmazásokhoz tervezték, ahol a költséghatékonyság többet jelent, mint a csúcspontos gondolkodási képesség.
Real-World Applications
▾
API-költségvetés előrejelzése: A fejlesztők megbecsülik a havi OpenAI API-költségeket a kérelmek várható mennyisége, az átlagos prompt hossza és a modellválasztás alapján a tervezési költségvetések beállításához.
Gyors optimalizálás: A mérnökök mérik a különböző prompt-tervek tokenszámát, hogy megtalálják a legköltséghatékonyabb összetételeket, amelyek megőrzik a kimeneti minőséget.
Chatbot-költségmodellezés: A termékcsapatok kiszámolják az AI chatbotok beszélgetésenkénti költségeit, hogy meghatározzák az árakat, a haszonkulcsot és azt, hogy az egyszerűbb lekérdezésekhez olcsóbb modelleket kell-e használni.
Dokumentumfeldolgozó csővezetékek: A vállalatok megbecsülik a nagy dokumentumkorpusok (szerződések, orvosi feljegyzések, jogi bejelentések) feldolgozásának költségét a GPT-4-en keresztül összegzés, kivonatolás vagy elemzés céljából.
Modellválasztás: A műszaki vezetők összehasonlítják a különböző modellek (GPT-4o vs. Claude vs. Gemini) feladatonkénti költségét, hogy kiválasszák az optimális modellt minden egyes felhasználási esethez.
Special Cases
▾
Nem angol szöveg és többnyelvű tokenizálás
A nem latin betűk (kínai, japán, koreai, arab, hindi) jellemzően 2-3-szor több tokent fogyasztanak szónként, mint az angol, mivel a tokenizer elsősorban angol szövegre lett kiképezve. Egy 1000 karakteres kínai szöveg 700-1000 jelzőt tartalmazhat, míg ugyanennyi angol nyelven csak 250 tokent. Ez jelentősen befolyásolja a többnyelvű alkalmazások költségeit.
Kód tokenizálás
A forráskód gyakran másképp tokenizál, mint a próza. A gyakori programozási kulcsszavak és szintaxis általában egyetlen tokenek, de a változónevek, karakterláncok és megjegyzések nagyon eltérőek. A behúzás és a szóköz tokeneket fogyaszt. A kicsinyített kód kevesebb tokent használ, mint a formázott kód. A Python általában hatékonyabban tokenizál, mint az olyan bőbeszédű nyelvek, mint a Java.
Gyorsítótárazott beviteli tokenek (Prompt Caching)
Az OpenAI 50%-os kedvezményt biztosít a gyorsítótárazott bemeneti tokenekre a GPT-4o és a GPT-4o mini esetében, ha ugyanazt a prompt előtagot használják az API-hívásokban. Ha a rendszerprompt (mondjuk 2000 token) megegyezik a kérések között, akkor az első híváskor teljes árat, a további hívásoknál pedig fél árat kell fizetnie a gyorsítótárazott tokenekért. Ez 20-40%-kal csökkentheti a költségeket a hosszú rendszerüzeneteket tartalmazó alkalmazásoknál.
OpenAI modell árazás (2025)
▾
| Modell | Bemenet (1 millió tokenenként) | Kimenet (1 millió tokenenként) | Kontextus ablak |
|---|---|---|---|
| GPT-4o | 2,50 dollár | 10,00 USD | 128K token |
| GPT-4o mini | 0,15 USD | 0,60 USD | 128K token |
| GPT-4 Turbo | 10,00 USD | 30,00 USD | 128K token |
| GPT-3.5 Turbo | 0,50 USD | 1,50 dollár | 16K token |
| o1 (okoskodás) | 15,00 USD | 60,00 USD | 200 ezer token |
| o1-mini | 3,00 USD | 12,00 USD | 128K token |
| Claude 3.5 szonett (antropikus) | 3,00 USD | 15,00 USD | 200 ezer token |
| Gemini 1.5 Pro (Google) | 1,25 dollár | 5,00 USD | 1 millió token |
Frequently Asked Questions
▾
Mi is pontosan a token?
A token egy részszóegység, amelyet az LLM-ek szövegfeldolgozásra használnak. Az olyan gyakori szavak, mint a 'the' vagy 'and' egyetlen tokenek, míg a hosszabb vagy szokatlan szavak több tokenre bonthatók (például a 'kriptovaluta' lehet 'crypto' + 'currency' = 2 token). Angolul 1 token átlagosan ~4 karakterből vagy ~0,75 szóból áll. A nem angol nyelvek és kódok általában eltérő token/szó arányúak.
Miért drágábbak a kimeneti tokenek, mint a bemeneti tokenek?
A kimeneti (befejezési) tokenek több számítást igényelnek, mint a bemeneti (prompt) tokenek, mivel a modellnek minden kimeneti tokent szekvenciálisan kell generálnia, és mindegyiknél teljes előrehaladást kell végrehajtania a neurális hálózaton. A bemeneti tokenek párhuzamosan is feldolgozhatók. A számítási költségek ezen aszimmetriája a kimeneti tokenek 2–4-szeres árprémiumában is megmutatkozik.
Mennyire pontos a tokenenkénti ~4 karakter?
A 4 karakteres közelítés meglehetősen pontos a normál angol prózában (10-15%-on belül). Ez azonban kevésbé pontos kód (amely tokenenként 2-3 karaktert használhat a szintaktikai szimbólumok miatt), nem latin írások (a kínai/japán 1-2 karaktert használhat tokenenként) és speciális terminológiák esetében. A pontos számláláshoz használja az OpenAI tiktoken könyvtárát vagy a tényleges tokenizert.
Mi az a kontextusablak, és miért számít?
A kontextusablak a tokenek maximális száma (bemenet + kimenet együttesen), amelyet egy modell egyetlen kérelemben feldolgozhat. A GPT-4o 128 000 token ablakkal rendelkezik (~96 000 szó). Ha a bevitel túllépi a kontextusablakot, akkor csonkolnia kell, össze kell foglalnia, vagy lekéréssel bővített generálást (RAG) kell használnia. A korlát túllépése API hibát ad vissza.
Beszámítanak a rendszerkérések és a beszélgetési előzmények a tokenhasználatba?
Igen. Minden API-hívás tartalmazza a teljes rendszerpromptot, az összes beszélgetési előzményt és az új felhasználói üzenetet bemeneti tokenként. A chatbotokban a beszélgetések előzményei minden fordulattal bővülnek, így a költségek a beszélgetések hosszabbodásával nőnek. Beszélgetés csonkolási vagy összegzési stratégiákat valósítson meg a költségek szabályozása érdekében a többfordulós alkalmazásokban.
Milyen a GPT-4o árazása a Claude-hoz és más modellekhez képest?
2025-től: A GPT-4o 2,50 USD/10,00 USD 1 millió tokenenként (bemenet/kimenet). Az Anthropic Claude 3.5 Sonnet 3,00 USD/15,00 USD/1 millió. A Google Gemini 1.5 Pro 1 millióanként 1,25 USD/5,00 USD. A GPT-4o mini 0,15 USD/0,60 USD áron a legolcsóbb határmodell opció. Az árak gyakran változnak, mivel a szolgáltatók versenyeznek a költség-teljesítmény terén.
Common Mistakes to Avoid
▾
- !Feltételezve, hogy 1 token = 1 szó – az angolban 1 token körülbelül 0,75 szót jelent (vagy 1 szó = ~1,33 token), és ez az arány jelentősen eltér más nyelveknél.
- !Elfelejti, hogy a beszélgetési előzmények minden fordulóban tokeneket halmoznak fel – egy 20 fordulós chatbot-beszélgetés kérésenként több mint 10 000 beviteli tokent küldhet, még akkor is, ha minden egyes üzenet rövid.
- !Nem számolva a rendszer prompt token költségével, amely minden API-hívásban benne van, és a részletes utasításokért 500-2000 token lehet.
- !A modellárak összehasonlítása a kimeneti minőségi különbségek figyelembevétele nélkül – a GPT-4o mini 17-szer olcsóbb, mint a GPT-4o, de az alacsonyabb érvelési képesség miatt több tokenre is szükség lehet ugyanazon eredmény eléréséhez.
- !Ha figyelmen kívül hagyjuk a bemeneti és kimeneti tokenek külön árazását – a kimeneti tokenek 2-4-szer drágábbak, így a hosszú válaszokat generáló alkalmazások aránytalanul drágábbak.
Pro Tip
Az API-költségek csökkentése a minőség feláldozása nélkül: (1) Használja a GPT-4o minit olyan egyszerű feladatokhoz, mint az osztályozás és a kinyerés, a GPT-4o-t az összetett érveléshez tartva fenn. (2) Valósítsa meg az azonnali gyorsítótárazást, hogy 50% kedvezményt kapjon az ismétlődő rendszerértesítésekre. (3) Állítsa be a max_tokens értéket, hogy megakadályozza a váratlanul hosszú kimeneteket. (4) A teljes átirat elküldése helyett foglalja össze a beszélgetési előzményeket. Egy jól optimalizált alkalmazás 60-80%-kal csökkentheti a költségeket a naiv API-használathoz képest.
Did you know?
A „tokenizáció” szónak az AI-ban furcsa kettős élete van – a természetes nyelvi feldolgozásban a szöveg részszavakra való felosztását, míg a kiberbiztonságban az érzékeny adatok nem érzékeny helyőrzőkkel való helyettesítését jelenti. Mindkét jelentés magában foglalja az információ kisebb egységekre történő átalakítását, de teljesen más célokra. Az OpenAI cl100k_base tokenizere pontosan 100 256 egyedi tokenből áll.
Regional Guides
▾
United States▾
European Union▾
Asia-Pacific▾
References
Szerezzen heti matematikai tippeket
Csatlakozzon 12 000+ feliratkozóhoz, akik minden héten kapnak tippeket a számológéphez.