What is Token Cost Calculator?
▾
टोकन कॉस्ट कॅल्क्युलेटर मजकूराचे टोकनमध्ये रूपांतर करतो आणि कोणत्याही LLM प्रदात्यासाठी अचूक API खर्चाची गणना करतो. टोकन हे सर्व प्रमुख भाषा मॉडेल API साठी मूलभूत बिलिंग युनिट आहेत, जेथे एक टोकन अंदाजे 4 इंग्रजी वर्ण किंवा 0.75 शब्द आहे. भिन्न प्रदाता भिन्न टोकनायझेशन योजना वापरतात: OpenAI GPT-4o साठी cl100k_base टोकनायझरसह बाइट-पेअर एन्कोडिंग (BPE) वापरते, Anthropic समान BPE टोकनायझर वापरते आणि Google Gemini SentencePiece वापरते. समान मजकूर प्रदात्यांमध्ये भिन्न टोकन संख्या तयार करू शकतो, ज्यामुळे खर्चाची गणना प्रभावित होते. हे कॅल्क्युलेटर कोणत्याही AI खर्च नियोजन व्यायामासाठी आवश्यक पहिली पायरी आहे. मासिक API खर्चाचा अंदाज लावण्याआधी, तुम्हाला तुमच्या ठराविक प्रॉम्प्ट आणि प्रतिसादांमध्ये किती टोकन आहेत हे जाणून घेणे आवश्यक आहे. 1,000-शब्दांचा दस्तऐवज इंग्रजीमध्ये अंदाजे 1,333 टोकन आहे. एक सामान्य चॅटबॉट सिस्टम प्रॉम्प्ट 200 ते 500 टोकन आहे. 5 उदाहरणांसह तपशीलवार काही-शॉट प्रॉम्प्ट 2,000 ते 3,000 टोकन असू शकतात. हे मोजमाप तुमची प्रति-विनंती आणि मासिक API खर्च थेट निर्धारित करतात. कॅल्क्युलेटर सर्व प्रमुख प्रदाते आणि मॉडेलना समर्थन देते, शेजारी-बाय-साइड टोकन संख्या आणि खर्च दर्शविते. यात एक मजकूर इनपुट मोड देखील समाविष्ट आहे जेथे तुम्ही अंदाजे ऐवजी अचूक टोकन संख्या मिळविण्यासाठी वास्तविक सूचना किंवा दस्तऐवज पेस्ट करू शकता. टोकनायझेशन समजून घेणे विशेषतः गैर-इंग्रजी भाषांसाठी महत्त्वाचे आहे, जेथे BPE भिन्न वर्ण संच कसे हाताळते या कारणास्तव समान शब्दार्थ सामग्रीसाठी टोकन संख्या इंग्रजीपेक्षा 1.5 ते 3 पट जास्त असू शकते.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
सूत्र
▾
किंमत = (टोकन संख्या / 1,000,000) x किंमत प्रति दशलक्ष टोकन. टोकन संख्या इंग्रजी मजकूरासाठी शब्द संख्या / 0.75 च्या जवळपास आहे. उदाहरणार्थ, 2,000-शब्दांची ब्लॉग पोस्ट अंदाजे 2,667 टोकन असते. GPT-4o वर इनपुट म्हणून त्यावर प्रक्रिया करणे (2,667 / 1,000,000) x $2.50 = $0.0067 खर्च येईल.Variable Legend
▾
| प्रतीक | नाव | एकक | वर्णन |
|---|---|---|---|
| T | टोकन संख्या | tokens | दिलेल्या मजकूर इनपुटसाठी टोकनायझरद्वारे उत्पादित टोकनची संख्या, जे सर्व प्रमुख LLM API प्रदात्यांद्वारे बिलिंगसाठी वापरलेले अचूक एकक आहे. |
| W | शब्द संख्या | words | इनपुट मजकूरातील शब्दांची संख्या, जी भाषा-विशिष्ट टोकन-प्रति-शब्द गुणोत्तर वापरून अंदाजे टोकन संख्येमध्ये रूपांतरित केली जाऊ शकते. |
| C | वर्ण संख्या | characters | स्पेस आणि विरामचिन्हांसह वर्णांची एकूण संख्या, ज्याला अंदाजे इंग्रजी टोकन संख्या 4 ने भागले जाऊ शकते. |
| P | प्रति दशलक्ष टोकन किंमत | USD per 1M tokens | निवडलेल्या मॉडेल आणि टोकन प्रकार (इनपुट किंवा आउटपुट) साठी बिलिंग दर, जो प्रदात्यांमध्ये आणि इनपुट आणि आउटपुट टोकनमध्ये भिन्न असतो. |
| L | भाषा गुणक | ratio | एक स्केलिंग घटक जो इतर भाषांसाठी इंग्रजी टोकन अंदाज समायोजित करतो, इंग्रजीसाठी 1.0 ते जपानी आणि कोरियनसाठी 2.0 ते 3.0 पर्यंत. |
| N | विनंती गणना | requests | प्रती-विनंती टोकन संख्यांवरून मासिक किंवा वार्षिक खर्चाच्या अंदाजासाठी वापरल्या जाणाऱ्या खर्चाच्या प्रकल्पासाठी API विनंतींची संख्या. |
How to Token Cost Calculator
▾
- 1तुमचा मजकूर कॅल्क्युलेटरमध्ये पेस्ट करून थेट प्रविष्ट करा किंवा अंदाजासाठी शब्द संख्या, वर्ण संख्या किंवा पृष्ठ संख्या निर्दिष्ट करा. डायरेक्ट टेक्स्ट इनपुट वास्तविक टोकनायझेशन अल्गोरिदम चालवून सर्वात अचूक टोकन संख्या प्रदान करते. अंदाजांसाठी, कॅल्क्युलेटर प्रति इंग्रजी शब्द (किंवा 1 टोकन प्रति 4 वर्ण) अंदाजे 1.33 टोकन्सचा प्रमाणित गुणोत्तर वापरतो. गैर-इंग्रजी मजकूर भाषा-विशिष्ट गुणक वापरतो.
- 2मोजणीसाठी वापरण्यासाठी टोकनायझर निवडा. OpenAI cl100k_base चा वापर GPT-4o, GPT-4o-mini आणि सर्वात वर्तमान OpenAI मॉडेल्ससाठी केला जातो. o200k_base tokenizer नवीन मॉडेल्ससाठी वापरले जाते. एन्थ्रोपिक आणि Google त्यांचे स्वतःचे टोकनायझर वापरतात. टोकनायझर्समधील फरक इंग्रजी मजकूरासाठी टोकन संख्यामध्ये 5 ते 15 टक्के आणि गैर-लॅटिन लिप्यांसाठी 30 टक्क्यांपर्यंत फरक निर्माण करतो.
- 3तुमच्या विशिष्ट मजकुरासाठी एकूण टोकन, टोकन प्रति शब्द गुणोत्तर आणि टोकन प्रति वर्ण गुणोत्तर दर्शविणारे टोकन काउंट ब्रेकडाउनचे पुनरावलोकन करा. जेव्हा तुमच्याकडे मोजण्यासाठी अचूक मजकूर नसतो तेव्हा हे प्रमाण तुम्हाला भविष्यातील अंदाज कॅलिब्रेट करण्यात मदत करते. बहुतेक इंग्रजी मजकूर प्रति शब्द 1.2 ते 1.4 टोकन तयार करतो, परंतु विशिष्ट शब्दावली, कोड किंवा URL सह तांत्रिक सामग्री प्रति शब्द 1.5 ते 2.0 टोकन तयार करू शकते कारण BPE असामान्य वर्ण अनुक्रम कसे हाताळते.
- 4खर्चाची गणना करण्यासाठी मॉडेल आणि किंमत श्रेणी निवडा. कॅल्क्युलेटर प्रत्येक प्रमुख मॉडेलसाठी इनपुट टोकन, आउटपुट टोकन किंवा दोन्ही म्हणून तुमच्या मजकुराची किंमत दाखवतो. हे शेजारी-बाय-साइड दृश्य मॉडेल निवडीचे खर्च परिणाम त्वरित प्रकट करते. उदाहरणार्थ, इनपुट म्हणून 10,000 टोकनची किंमत GPT-4o वर $0.025 आहे परंतु GPT-4o-mini वर फक्त $0.0015 आहे, हा 16x फरक आहे.
- 5सामान्य दस्तऐवज प्रकारांसाठी खर्चाची गणना करण्यासाठी बॅच अंदाज मोड वापरा. कॅल्क्युलेटरमध्ये ठराविक दस्तऐवज आकारांसाठी प्रीसेट समाविष्ट आहेत: ईमेल (150 ते 300 टोकन), चॅट संदेश (50 ते 150 टोकन), ब्लॉग पोस्ट (1,500 ते 3,000 टोकन), कायदेशीर करार (10,000 ते 50,000 टोकन), आणि पुस्तक प्रकरण (5,00 ते 500 टोकन). हे प्रीसेट गैर-तांत्रिक भागधारकांना परिचित दस्तऐवज प्रकारांच्या संदर्भात खर्च समजण्यास मदत करतात.
- 6प्रत्येक भाषांमध्ये टोकन संख्या कशी बदलते हे दर्शवणारी भाषा गुणक सारणी एक्सप्लोर करा. जपानी मजकूर इंग्रजीपेक्षा प्रति शब्द 2 ते 3 पट जास्त टोकन वापरतो. चिनी 1.5 ते 2 पट जास्त वापरतात. अरबी आणि हिंदी 1.3 ते 1.8 पट जास्त वापरतात. हे गुणक बहुभाषिक अनुप्रयोगांचे अंदाजपत्रक तयार करण्यासाठी महत्त्वपूर्ण आहेत जेथे खर्च केवळ इंग्रजी-अंदाज सूचित करण्यापेक्षा लक्षणीय जास्त असू शकतो.
- 7खर्चाचा अंदाज म्हणून गणना निर्यात करा जी वित्त संघांसह सामायिक केली जाऊ शकते किंवा प्रकल्प प्रस्तावांमध्ये समाविष्ट केली जाऊ शकते. निर्यातीत टोकन संख्या, प्रति-विनंती खर्च आणि वेगवेगळ्या खंडांवर मासिक अंदाज समाविष्ट आहेत, जे बजेट मंजूरी आणि विक्रेता तुलनांसाठी आवश्यक डेटा प्रदान करतात.
Worked Examples
▾
350-शब्द प्रणाली प्रॉम्प्ट 467 टोकन्स (प्रति शब्द 1.33 टोकन) टोकनाइज करते. प्रत्येक API कॉलसह पाठवले जाते, याची किंमत प्रति विनंती $0.0012 आहे. 100,000 मासिक विनंत्यांवर, एकट्या सिस्टम प्रॉम्प्टची किंमत प्रति महिना $117 आहे, प्रॉम्प्ट ऑप्टिमायझेशन उच्च-लीव्हरेज खर्च कमी करते.
1,500-शब्दांचे ब्लॉग पोस्ट अंदाजे 2,000 आउटपुट टोकन व्युत्पन्न करते. GPT-4o आउटपुट किंमत $10 प्रति दशलक्ष, प्रत्येक लेख तयार करण्यासाठी $0.02 खर्च येतो. 500 टोकन ($0.00125) च्या इनपुट प्रॉम्प्टसह, प्रति लेख एकूण किंमत अंदाजे $0.021 आहे.
BPE टोकनायझेशन जपानी वर्ण कसे हाताळते यामुळे जपानी भाषेतील समान अर्थविषयक सामग्री इंग्रजीपेक्षा अंदाजे दुप्पट टोकन वापरते. हा 2x गुणक सर्व टोकन-आधारित खर्चांवर लागू होतो, ज्यामुळे CJK भाषांसाठी बहुभाषिक अनुप्रयोग लक्षणीयरीत्या महाग होतात.
25-पानांच्या कायदेशीर करारामध्ये अंदाजे 12,500 शब्द किंवा 16,875 टोकन असतात. क्लॉड सॉनेट 4 सह त्याचे विश्लेषण करण्यासाठी प्रति विश्लेषण इनपुट टोकनमध्ये $0.051 खर्च येतो. हे 200K संदर्भ विंडोमध्ये आरामात बसते, तपशीलवार सिस्टम प्रॉम्प्ट आणि एकाधिक विश्लेषण पाससाठी जागा.
Real-World Applications
▾
उत्पादन व्यवस्थापक विकास सुरू होण्यापूर्वी वैशिष्ट्य खर्चाचा अंदाज घेण्यासाठी टोकन कॅल्क्युलेटर वापरतात. एक पंतप्रधान दस्तऐवजाच्या सारांशाचे वैशिष्ट्य मोजतो की ठराविक ग्राहक दस्तऐवज 5,000 टोकन असतात आणि सारांश 500 टोकन असतात. GPT-4o-mini किंमतीवर, प्रत्येक सारांशची किंमत $0.001 आहे. अपेक्षित 50,000 मासिक सारांशांसह, वैशिष्ट्याची किंमत API खर्चामध्ये प्रति महिना $50 आहे, 5,000 वापरकर्त्यांना सेवा देणाऱ्या $10 प्रति महिना सदस्यत्व वैशिष्ट्यासाठी स्वीकार्य श्रेणीमध्ये आहे.
वित्त संघ त्रैमासिक बजेट नियोजनासाठी टोकन खर्च अंदाज वापरतात. SaaS कंपनीतील वित्त विश्लेषक तीन परिस्थितींचे मॉडेल करण्यासाठी कॅल्क्युलेटर वापरतात: पुराणमतवादी (100,000 मासिक API कॉल), अपेक्षित (250,000), आणि उच्च-वाढ (500,000). GPT-4o वर 800 इनपुट टोकन आणि 300 आउटपुट टोकन प्रति कॉलवर, अंदाजित मासिक खर्च अनुक्रमे $500, $1,250 आणि $2,500 आहेत. ही श्रेणी 30 टक्के बफरसह आर्थिक अंदाजामध्ये समाविष्ट केली आहे.
विकसक खर्च कार्यक्षमतेसाठी प्रॉम्प्ट्स ऑप्टिमाइझ करण्यासाठी टोकन कॅल्क्युलेटर वापरतात. एका अभियंत्याला कळते की त्यांच्या 800-टोकन सिस्टीम प्रॉम्प्टची गुणवत्ता कमी न करता 350 टोकनपर्यंत कमी केली जाऊ शकते. GPT-4o वर 200,000 मासिक API कॉल्सवर, हे दरमहा 90 दशलक्ष इनपुट टोकन्सची बचत करते, केवळ इनपुट टोकन्ससाठी दरमहा $500 ते $225 खर्च कमी करते, सिंगल प्रॉम्प्ट ऑप्टिमायझेशनमधून $3,300 वार्षिक बचत.
स्थानिकीकरण कार्यसंघ बहुभाषिक AI वैशिष्ट्यांचे बजेट करण्यासाठी भाषा गुणक अंदाज वापरतात. इंग्रजी, जपानी, चायनीज आणि स्पॅनिशमध्ये चॅटबॉट तैनात करण्याची योजना आखत असलेल्या टीमचा अंदाज आहे की जपानी आवृत्तीसाठी टोकन खर्च 2x इंग्रजी, चीनी 1.7x आणि स्पॅनिश 1.15x असेल. इंग्रजीमध्ये दरमहा $500 खर्चाच्या वैशिष्ट्यासाठी, चार-भाषेतील उपयोजनासाठी दरमहा अंदाजे $2,925 खर्च येईल, साधारण 4x गणनेनुसार $2,000 नाही.
Special Cases
▾
स्त्रोत कोड टोकनिंग करताना, टोकन कार्यक्षमता प्रोग्रामिंग भाषा आणि कोडिंग शैलीवर खूप अवलंबून असते.
'calculate_monthly_revenue' सारख्या वर्णनात्मक व्हेरिएबल नावांसह Python कोड 4 ते 5 टोकनमध्ये विभागला जाऊ शकतो, तर लहान JavaScript बंडलमधील समान व्हेरिएबल लहान नावांमुळे कमी टोकन वापरतो. JSON आणि XML विशेषतः टोकन-अकार्यक्षम आहेत पुनरावृत्ती संरचनात्मक वर्णांमुळे (ब्रेसेस, कंस, अवतरण, कोन कंस). 1KB JSON ऑब्जेक्ट 300 ते 400 टोकन वापरू शकतो, तर कॉम्पॅक्ट फॉरमॅटमधील समान डेटा 200 टोकन वापरू शकतो.
बेस64-एनकोडेड सामग्री (इमेज, फाइल्स, बायनरी डेटा) समाविष्ट असलेल्या प्रॉम्प्टसाठी
बेस64-एनकोड केलेली सामग्री (इमेज, फाइल्स, बायनरी डेटा) समाविष्ट असलेल्या प्रॉम्प्टसाठी, टोकनचा वापर खूप जास्त आहे कारण बेस64 वर्ण सामान्य BPE टोकन अनुक्रम तयार करत नाहीत. 1KB बेस64 स्ट्रिंग 1,300 ते 1,500 टोकन वापरू शकते. जेव्हा शक्य असेल तेव्हा मजकूर टोकन म्हणून बेस64-एनकोड केलेली सामग्री पाठवणे टाळा. मूळ फाइल अपलोड वैशिष्ट्ये किंवा इमेज इनपुट मोड वापरा जे एन्कोडिंग अधिक कार्यक्षमतेने हाताळतात.
संभाषण इतिहासासह चॅट अनुप्रयोगांसाठी टोकन मोजताना, लक्षात ठेवा
संभाषण इतिहासासह चॅट ऍप्लिकेशन्ससाठी टोकन मोजताना, लक्षात ठेवा की विशेष टोकन (संदेश रोल मार्कर, टर्न सेपरेटर) एक लहान परंतु नगण्य ओव्हरहेड जोडतात. संभाषणातील प्रत्येक संदेश रोल मार्कर आणि विभाजकांसाठी अंदाजे 4 ते 6 विशेष टोकन जोडतो. 20-वळणाच्या संभाषणात, हे 80 ते 120 टोकन जोडते जे तुमच्या मजकुरात दिसत नाहीत परंतु बिलिंगसाठी मोजले जातात. GPT-4o किंमतीनुसार, या ओव्हरहेडची किंमत प्रत्येक संभाषणासाठी अंदाजे $0.0003 आहे, जी वैयक्तिक संभाषणांसाठी क्षुल्लक आहे परंतु मोठ्या प्रमाणात वाढते.
भाषेनुसार टोकन कार्यक्षमता (BPE Tokenizer)
▾
| भाषा | प्रति शब्द टोकन | प्रति 1K वर्ण टोकन | गुणक वि इंग्रजी | उदाहरण (100 शब्द) |
|---|---|---|---|---|
| इंग्रजी | 1.3 | 250 | 1.0x | ~130 टोकन |
| स्पॅनिश | 1.5 | 270 | 1.15x | ~150 टोकन |
| फ्रेंच | 1.5 | 275 | 1.15x | ~150 टोकन |
| जर्मन | 1.8 | 280 | 1.38x | ~180 टोकन |
| अरबी | 2.0 | 350 | 1.54x | ~200 टोकन |
| हिंदी | 2.2 | 400 | 1.69x | ~220 टोकन |
| चिनी | 2.0 | 500 | 1.54x | ~200 टोकन |
| जपानी | 2.5 | 550 | 1.92x | ~250 टोकन |
| कोरियन | 2.3 | 500 | 1.77x | ~230 टोकन |
Frequently Asked Questions
▾
टोकन म्हणजे नक्की काय?
टोकन हा मजकूराचा एक तुकडा आहे ज्यावर भाषा मॉडेल एक युनिट म्हणून प्रक्रिया करते. टोकन हे टोकनायझर अल्गोरिदम (सामान्यत: बाइट-पेअर एन्कोडिंग) द्वारे तयार केले जातात जे मजकूर सामान्य वर्ण अनुक्रमांमध्ये विभाजित करतात. 'हॅलो' किंवा 'द' सारखे सामान्य इंग्रजी शब्द एकल टोकन आहेत. 'असाधारण' सारखे मोठे शब्द 'अतिरिक्त' आणि 'सामान्य' (2 टोकन) मध्ये विभाजित केले जाऊ शकतात. एक स्पेस अनेकदा खालील शब्दाला एकल टोकन म्हणून जोडते. संख्या, विरामचिन्हे आणि विशेष वर्ण प्रत्येक टोकन वापरतात.
4-वर्ण-प्रति-टोकन नियम किती अचूक आहे?
4-वर्ण-प्रति-टोकन अंदाजे साधारण इंग्रजी गद्यासाठी 10 ते 20 टक्क्यांच्या आत अचूक आहे. हे ब्लॉग पोस्ट, ईमेल आणि संभाषणात्मक मजकूरासाठी चांगले कार्य करते. हे कोडसाठी कमी अचूक आहे (वाक्यरचना वर्णांमुळे प्रति टोकन 3 वर्ण), विशेष अटींसह तांत्रिक लेखन (प्रति टोकन 3.5 वर्ण), आणि गैर-इंग्रजी मजकूर (CJK साठी प्रति टोकन 2 ते 3 वर्ण). किंमत-गंभीर अनुप्रयोगांसाठी, वर्ण-आधारित अंदाजाऐवजी नेहमी अचूक टोकनायझर वापरा.
भिन्न मॉडेल एकाच मजकुरासाठी भिन्न टोकन संख्या तयार करतात?
होय. OpenAI GPT-4o cl100k_base टोकनायझर वापरते, तर जुने GPT-3.5 मॉडेल वेगळे एन्कोडिंग वापरतात. एन्थ्रोपिक क्लॉड आणि Google जेमिनी त्यांचे स्वतःचे टोकनायझर वापरतात. समान 1,000-शब्द इंग्रजी मजकूर GPT-4o वर 1,320 टोकन, क्लॉडवर 1,350 आणि जेमिनीवर 1,280 टोकन तयार करू शकतो. फरक इंग्रजीसाठी सामान्यत: 5 ते 15 टक्के असतात परंतु गैर-लॅटिन लिपींसाठी 30 टक्क्यांपर्यंत पोहोचू शकतात. तंतोतंत किंमत तुलनासाठी, प्रत्येक प्रदात्यासह तुमचा मजकूर टोकनाइज करा.
जपानी मजकुराची जास्त किंमत का आहे?
BPE टोकनायझर्सना मोठ्या मजकूर कॉर्पोरा वर प्रशिक्षित केले जाते जे प्रामुख्याने इंग्रजी असतात. इंग्रजी शब्द आणि सामान्य वाक्ये एकल टोकन म्हणून कार्यक्षमतेने दर्शविले जातात. प्रशिक्षण डेटामध्ये जपानी वर्ण (हिरगाना, काटाकाना, कांजी) कमी वेळा आढळतात, म्हणून टोकनायझर त्यांना अधिक तुकड्यांमध्ये विभाजित करतो. संपूर्ण शब्द संकल्पना दर्शविणारा एकल कांजी वर्ण 2 ते 3 टोकन वापरू शकतो. म्हणूनच जपानी मजकूर इंग्रजीपेक्षा 2 ते 3 पट अधिक टोकन वापरतो.
मी प्रोग्रॅमॅटिकरित्या टोकन्स कसे मोजू?
OpenAI मॉडेल्ससाठी, tiktoken Python लायब्ररी वापरा: tiktoken आयात करा, नंतर enc = tiktoken.get_encoding('cl100k_base'), आणि token_count = len(enc.encode(your_text)). एन्थ्रोपिकसाठी, एन्थ्रोपिक पायथन लायब्ररी वापरा ज्यामध्ये टोकन मोजणी पद्धत समाविष्ट आहे. सामान्य अंदाजांसाठी, वर्ण संख्या 4 ने विभाजित करा किंवा शब्द संख्या 1.33 ने गुणा. टिकटोकन लायब्ररी नगण्य ओव्हरहेड जोडते आणि प्रति सेकंद लाखो टोकन प्रक्रिया करू शकते.
प्रतिमा आणि फाइल टोकन वापरतात का?
GPT-4o सारख्या मल्टी-मॉडल मॉडेल्सना प्रतिमा पाठवताना, रिजोल्यूशनच्या आधारावर प्रतिमा टोकनमध्ये रूपांतरित केल्या जातात. कमी-रिझोल्यूशन प्रतिमेची किंमत 85 टोकन असते आणि उच्च-रिझोल्यूशन प्रतिमेची किंमत आकारमानानुसार 170 ते 1,105 टोकन असते. प्रतिमा म्हणून पाठवलेली PDF पृष्ठे प्रति पृष्ठ 1,000 ते 3,000 टोकन वापरतात. व्हिस्परला पाठवलेल्या ऑडिओचे शुल्क कालावधीनुसार आकारले जाते, टोकन नाही. मजकूर म्हणून पाठवलेल्या फाइल्स (साधा मजकूर, कोड फाइल्स) सामान्यपणे टोकनाइज्ड असतात.
मला काळजी करण्याची कमाल टोकन मर्यादा किती आहे?
प्रत्येक मॉडेलमध्ये एक संदर्भ विंडो असते जी एकूण इनपुट आणि आउटपुट टोकन मर्यादित करते. GPT-4o 128K टोकनला सपोर्ट करते, क्लॉड मॉडेल 200K टोकनला सपोर्ट करते आणि जेमिनी 1.5 प्रो 1 दशलक्ष टोकनला सपोर्ट करते. व्यवहारात, बहुतेक अनुप्रयोग प्रत्येक विनंतीसाठी 1,000 ते 10,000 टोकन वापरतात. संदर्भ विंडो ओलांडल्याने API मध्ये त्रुटी येते. लांब दस्तऐवजांसाठी, मर्यादेत राहण्यासाठी चंकिंग किंवा सारांश लागू करा.
Common Mistakes to Avoid
▾
- !एक टोकन एक शब्द समान गृहीत धरून:
- !बहुभाषिक मजकुरासाठी इंग्रजी टोकन गुणोत्तर वापरणे:
- !कोड विसरणे आणि संरचित डेटा भिन्नपणे टोकनाइज:
Pro Tip
कोणतेही LLM-संचालित वैशिष्ट्य लाँच करण्यापूर्वी, टोकन बजेट स्प्रेडशीट तयार करा जे तुमच्या सिस्टम प्रॉम्प्टची अचूक टोकन संख्या, सरासरी वापरकर्ता इनपुट, सरासरी मॉडेल आउटपुट आणि मासिक विनंत्यांची संख्या दस्तऐवजीकरण करते. यास 30 मिनिटे लागतात आणि सर्वात सामान्य किंमत आश्चर्यचकित होण्यापासून प्रतिबंधित करते: लाँच केल्यानंतर लक्षात आले की तुमचा वास्तविक टोकन वापर तुमच्या नॅपकिनच्या मागील अंदाजापेक्षा 3 ते 5 पट जास्त आहे. वास्तविक मोजलेल्या मूल्यांसह स्प्रेडशीट मासिक अद्यतनित करा.
Did you know?
GPT-4o द्वारे वापरलेले BPE (बाइट-पेअर एन्कोडिंग) टोकनायझर इतके मोठ्या कॉर्पसवर प्रशिक्षित केले गेले होते की 'the', 'आणि', 'is' सारख्या सामान्य शब्दांनंतर एकल स्पेस वर्ण प्रत्येक वैयक्तिक टोकन आहेत. cl100k_base साठी टोकन शब्दसंग्रहामध्ये अगदी 100,256 अद्वितीय टोकन आहेत. याचा अर्थ मॉडेल 100,256 भिन्न मजकूर नमुन्यांची एकल युनिट म्हणून प्रतिनिधित्व करू शकते, ज्यामध्ये सर्वात सामान्य इंग्रजी शब्द आणि वाक्यांश सर्वात कार्यक्षमतेने एन्कोड केलेले आहेत.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
साप्ताहिक गणित टिप्स मिळवा
दर आठवड्याला कॅल्क्युलेटर टिपा मिळवणाऱ्या १२,०००+ सदस्यांमध्ये सामील व्हा.