क्या है LLM Latency Cost Calculator?
▾
एलएलएम लेटेंसी कॉस्ट कैलकुलेटर डेवलपर्स को टाइम-टू-फर्स्ट-टोकन (टीटीएफटी), टोकन-प्रति-सेकंड थ्रूपुट और विभिन्न मॉडलों और कॉन्फ़िगरेशन में कुल प्रतिक्रिया समय को मॉडलिंग करके एआई अनुप्रयोगों में प्रतिक्रिया समय की छिपी हुई लागत को मापने में मदद करता है। जबकि अधिकांश लागत चर्चाएँ टोकन मूल्य निर्धारण पर ध्यान केंद्रित करती हैं, विलंबता का अपना आर्थिक प्रभाव होता है: धीमी प्रतिक्रियाएँ उपयोगकर्ता के परित्याग को बढ़ाती हैं, थ्रूपुट क्षमता को कम करती हैं, और एआई-संचालित सुविधाओं की कथित गुणवत्ता को ख़राब करती हैं। विभिन्न मॉडलों और प्रदाताओं में विलंबता नाटकीय रूप से भिन्न होती है। GPT-4o आम तौर पर 200 से 500 मिलीसेकंड में टाइम-टू-फर्स्ट-टोकन वितरित करता है और प्रति सेकंड 80 से 120 टोकन उत्पन्न करता है। GPT-4o-मिनी 100 से 300ms TTFT और 100 से 150 टोकन प्रति सेकंड पर तेज़ है। क्लाउड सॉनेट 4 की रेंज 300 से 700ms TTFT और 70 से 100 टोकन प्रति सेकंड है। इन अंतरों का मतलब है कि 500-टोकन प्रतिक्रिया में मॉडल की पसंद के आधार पर 3 से 7 सेकंड लगते हैं, जो सीधे उपयोगकर्ता अनुभव और एप्लिकेशन डिज़ाइन को प्रभावित करता है। यह कैलकुलेटर विलंबता की कुल लागत को मॉडल करता है जिसमें प्रत्यक्ष एपीआई लागत, कनेक्शन को खुला रखने की बुनियादी ढांचा लागत, प्रतिक्रिया समय के साथ सहसंबद्ध उपयोगकर्ता ड्रॉप-ऑफ दरें और समान अनुरोध मात्रा को पूरा करने के लिए अधिक समवर्ती कनेक्शन की आवश्यकता वाले धीमे मॉडल के थ्रूपुट निहितार्थ शामिल हैं। चैटबॉट और खोज जैसे वास्तविक समय के अनुप्रयोगों के लिए, विलंबता अनुकूलन समग्र सिस्टम अर्थशास्त्र के लिए टोकन लागत अनुकूलन जितना ही प्रभावशाली हो सकता है।
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
सूत्र
▾
कुल प्रतिक्रिया समय = पहले टोकन का समय + (आउटपुट टोकन/टोकन प्रति सेकंड)। प्रति अनुरोध प्रभावी लागत = एपीआई टोकन लागत + (प्रतिक्रिया समय / 3600) x सर्वर कनेक्शन लागत प्रति घंटा + ड्रॉप-ऑफ संभावना x प्रति उपयोगकर्ता खोया हुआ राजस्व। उदाहरण के लिए: 400ms TTFT + 100 tok/s पर 300 टोकन = 400ms + 3,000ms = 3.4 सेकंड कुल प्रतिक्रिया समय।चर विवरण
▾
| प्रतीक | नाम | इकाई | विवरण |
|---|---|---|---|
| TTFT | प्रथम टोकन का समय | milliseconds | एपीआई अनुरोध भेजने और प्रतिक्रिया का पहला टोकन प्राप्त करने के बीच देरी, जो न्यूनतम कथित विलंबता का प्रतिनिधित्व करती है। |
| TPS | प्रति सेकंड टोकन | tokens per second | पहले टोकन के बाद पीढ़ी की गति, यह निर्धारित करती है कि पूर्ण प्रतिक्रिया कितनी जल्दी उत्पन्न होती है, आमतौर पर मानक मॉडल के लिए 80 से 150। |
| T_out | आउटपुट टोकन गणना | tokens | मॉडल प्रतिक्रिया में टोकन की संख्या, जिसे पीढ़ी की गति से गुणा किया जाता है, टीटीएफटी के बाद स्ट्रीमिंग अवधि निर्धारित करती है। |
| D | ड्रॉप-ऑफ़ दर | ratio per second of latency | प्रतिक्रिया समय के प्रति अतिरिक्त सेकंड में बातचीत छोड़ने वाले उपयोगकर्ताओं का अनुमानित अंश, आम तौर पर 3-सेकंड की सीमा से ऊपर प्रति सेकंड 5 से 15 प्रतिशत है। |
| V_user | प्रति खोए हुए उपयोगकर्ता का मूल्य | USD | जब कोई उपयोगकर्ता अत्यधिक विलंबता के कारण एआई इंटरैक्शन को छोड़ देता है तो अनुमानित राजस्व या ग्राहक मूल्य की हानि होती है। |
कैसे LLM Latency Cost Calculator
▾
- 1अपने चुने हुए मॉडल और कॉन्फ़िगरेशन के लिए टाइम-टू-फर्स्ट-टोकन (TTFT) को मापें या अनुमान लगाएं। टीटीएफटी एपीआई अनुरोध भेजने और प्रतिक्रिया का पहला टोकन प्राप्त करने के बीच की देरी है। यह मॉडल जटिलता, इनपुट प्रॉम्प्ट लंबाई, सर्वर लोड और एपीआई एंडपॉइंट की भौगोलिक दूरी पर निर्भर करता है। GPT-4o TTFT की रेंज 200 से 500ms तक होती है, जबकि o1 जैसे तर्क मॉडल को प्रारंभिक सोच चरण के लिए 2 से 10 सेकंड का समय लग सकता है।
- 2अपने मॉडल के लिए टोकन-प्रति-सेकंड पीढ़ी दर निर्धारित करें। यह वह गति है जिस पर मॉडल पहला टोकन आने के बाद आउटपुट टोकन उत्पन्न करता है। मानक मॉडल प्रति सेकंड 80 से 150 टोकन उत्पन्न करते हैं। लंबे आउटपुट में आनुपातिक रूप से अधिक समय लगता है: टीटीएफटी के बाद 100 टोकन प्रति सेकंड पर 500-टोकन प्रतिक्रिया में 5 सेकंड लगते हैं। उपयोगकर्ताओं की प्रतिक्रिया को स्ट्रीम करने से टोकन आने पर कथित विलंबता कम हो जाती है।
- 3अपनी विशिष्ट आउटपुट लंबाई के लिए कुल प्रतिक्रिया समय की गणना करें। GPT-4o पर 200-टोकन प्रतिक्रियाओं वाले चैटबॉट के लिए: TTFT (350ms) + जनरेशन (200 टोकन / 100 tok/s = 2,000ms) = कुल 2.35 सेकंड। 1,000-टोकन आउटपुट के साथ सामग्री निर्माण सुविधा के लिए: TTFT (350ms) + पीढ़ी (10,000ms) = 10.35 सेकंड। ये समय निर्धारित करते हैं कि सुविधा उपयोगकर्ताओं को प्रतिक्रियाशील या सुस्त लगती है या नहीं।
- 4विलंबता के उपयोगकर्ता अनुभव प्रभाव को मॉडल करें। अनुसंधान से पता चलता है कि उपयोगकर्ता संतुष्टि 3-सेकंड प्रतिक्रिया समय से काफी कम हो जाती है। चैटबॉट्स के लिए, 5 सेकंड से अधिक की प्रतिक्रियाओं के कारण 20 से 30 प्रतिशत उपयोगकर्ता बातचीत छोड़ देते हैं। खोज सुविधाओं के लिए, 2 सेकंड से अधिक समय लेने वाले परिणामों में 10 से 15 प्रतिशत कम सहभागिता देखी जाती है। कैलकुलेटर आपकी रूपांतरण दरों और उपयोगकर्ता के जीवनकाल मूल्य के आधार पर इस खोई हुई सहभागिता के लिए एक डॉलर मूल्य निर्दिष्ट करता है।
- 5थ्रूपुट क्षमता और इसके लागत निहितार्थ की गणना करें। स्ट्रीमिंग प्रतिक्रियाओं को संभालने वाले सर्वर को पूर्ण प्रतिक्रिया अवधि के लिए कनेक्शन खुला रखना चाहिए। यदि प्रत्येक प्रतिक्रिया में 5 सेकंड लगते हैं, तो एक सर्वर थ्रेड प्रति मिनट 12 अनुरोधों को संभालता है। 2 सेकंड में प्रतिक्रिया देने वाले तेज़ मॉडल पर स्विच करने से थ्रूपुट प्रति मिनट 30 अनुरोधों तक बढ़ जाता है, जिससे समान ट्रैफ़िक के लिए 60 प्रतिशत कम सर्वर संसाधनों की आवश्यकता होती है। यह बुनियादी ढांचा बचत मॉडलों के बीच एपीआई लागत अंतर से अधिक हो सकती है।
- 6टोकन मूल्य निर्धारण और विलंबता लागत दोनों सहित मॉडल विकल्पों में कुल लागत की तुलना करें। एक सस्ता-प्रति-टोकन मॉडल जो धीमा है, बुनियादी ढांचे, उपयोगकर्ता ड्रॉप-ऑफ और थ्रूपुट बाधाओं को ध्यान में रखते हुए वास्तव में अधिक खर्च हो सकता है। कैलकुलेटर कुल आर्थिक तुलना तैयार करता है जिसमें एपीआई लागत, सर्वर लागत और विलंबता से अनुमानित राजस्व प्रभाव शामिल होता है।
- 7कॉन्फ़िगरेशन परिवर्तनों के माध्यम से विलंबता को अनुकूलित करें। max_tokens के साथ आउटपुट टोकन सीमा को कम करना, कथित प्रतिक्रिया में सुधार करने के लिए स्ट्रीमिंग का उपयोग करना, TTFT को कम करने के लिए त्वरित कैशिंग लागू करना, और भौगोलिक रूप से करीबी एपीआई एंडपॉइंट चुनने से प्रत्येक मॉडल को बदले बिना विलंबता को 20 से 50 प्रतिशत तक कम कर सकता है। कैलकुलेटर प्रत्येक अनुकूलन के लागत प्रभाव को मॉडल करता है।
हल किए गए उदाहरण
▾
3-सेकंड प्रतिक्रियाओं के तहत लक्षित चैटबॉट के लिए, GPT-4o और GPT-4o-मिनी दोनों सीमा को पूरा करते हैं जबकि क्लाउड सॉनेट 4 सीमा रेखा है। GPT-4o-मिनी, GPT-4o से 28 प्रतिशत तेज़ और 94 प्रतिशत सस्ता है, जो इसे अधिकांश चैटबॉट अनुप्रयोगों के लिए इष्टतम विकल्प बनाता है।
प्रत्येक 1,000-टोकन पीढ़ी में 10.4 सेकंड लगते हैं। 50 समवर्ती उपयोगकर्ताओं को सेवा प्रदान करने के लिए, आपको लगभग 9 सर्वर थ्रेड्स की आवश्यकता होगी जिनके कनेक्शन खुले हों। सर्वर इंफ्रास्ट्रक्चर के लिए $5 प्रति घंटे पर, थ्रूपुट लागत एपीआई टोकन लागत के शीर्ष पर प्रति अनुरोध $0.0024 जोड़ती है।
पुनर्प्राप्ति के लिए 200ms और 150ms TTFT के बाद, टोकन जनरेशन के लिए 1,450ms शेष रहते हैं। 130 टोकन प्रति सेकंड पर, अधिकतम आउटपुट 188 टोकन है। यदि सुविधा को लंबी प्रतिक्रियाओं की आवश्यकता है, तो या तो विलंबता बजट बढ़ाना होगा या तेज़ मॉडल या कम पुनर्प्राप्ति समय की आवश्यकता होगी।
वास्तविक अनुप्रयोग
▾
एआई-संचालित उत्तर पीढ़ी वाले खोज इंजनों को पारंपरिक खोज द्वारा निर्धारित उपयोगकर्ता की अपेक्षाओं से मेल खाने के लिए 2 से 3 सेकंड के भीतर परिणाम देना होगा। उत्तर संश्लेषण के लिए GPT-4o का उपयोग करने वाला एक खोज प्लेटफ़ॉर्म पुनर्प्राप्ति के लिए 500ms और LLM पीढ़ी के लिए 2,000ms का बजट रखता है। 100 टोकन प्रति सेकंड पर, वे विलंबता बजट के भीतर लगभग 170 टोकन (लगभग 130 शब्द) उत्पन्न कर सकते हैं। यह बाधा अधिकतम उत्तर लंबाई निर्धारित करती है और सबसे तेज़ उपलब्ध मॉडल के चयन को प्रेरित करती है।
वास्तविक समय अनुवाद सेवाओं को वार्तालाप प्रवाह के लिए विलंबता को कम करना चाहिए। GPT-4o-मिनी का उपयोग करते हुए एक लाइव अनुवाद सुविधा 150ms TTFT और 130 टोकन प्रति सेकंड प्राप्त करती है, कुल 0.77 सेकंड में 50-शब्द वाक्य (लगभग 80 टोकन आउटपुट) का अनुवाद करती है। यह उप-सेकंड विलंबता स्वाभाविक वार्तालाप गति को सक्षम बनाती है। इसके बजाय GPT-4o का उपयोग करने से 200ms TTFT जुड़ जाएगा और थ्रूपुट कम हो जाएगा, जिससे ध्यान देने योग्य रुकावट पैदा होगी जो बातचीत के प्रवाह को तोड़ देगी।
ट्रेडिंग और वित्तीय विश्लेषण प्लेटफ़ॉर्म वास्तविक समय की बाज़ार टिप्पणी और अलर्ट जनरेशन के लिए एलएलएम का उपयोग करते हैं। विलंबता सीधे तौर पर बाज़ार-गतिशील जानकारी के मूल्य पर प्रभाव डालती है। 100-टोकन बाजार अलर्ट के लिए जीपीटी-4ओ-मिनी का उपयोग करने वाला एक वित्तीय मंच समय-संवेदनशील वित्तीय जानकारी की आवश्यकता को पूरा करते हुए, 1 सेकंड से कम समय में डिलीवरी प्राप्त करता है। प्लेटफ़ॉर्म लंबे विश्लेषणात्मक टुकड़ों को पृष्ठभूमि में GPT-4o पर रूट करता है जहां विलंबता कम महत्वपूर्ण होती है।
वॉयस असिस्टेंट और वॉयस-सक्षम एआई अनुप्रयोगों में सख्त विलंबता बजट होता है क्योंकि उपयोगकर्ता तत्काल मौखिक प्रतिक्रियाओं की अपेक्षा करते हैं। स्पीच-टू-टेक्स्ट (300 से 500 एमएस) से एलएलएम जनरेशन से टेक्स्ट-टू-स्पीच (200 से 400 एमएस) तक की कुल पाइपलाइन 2 से 3 सेकंड के भीतर पूरी होनी चाहिए। इससे एलएलएम पीढ़ी के लिए केवल 1 से 2 सेकंड का समय बचता है, जिससे मॉडल का चयन और प्रतिक्रिया की लंबाई सीमित हो जाती है। कई वॉयस एप्लिकेशन विशेष रूप से अपने तेज़ टीटीएफटी के लिए जीपीटी-4ओ-मिनी या क्लाउड हाइकू का उपयोग करते हैं।
विशेष मामले
▾
O1 और O3 जैसे तर्क मॉडल के लिए, TTFT में एक विस्तारित सोच शामिल है
O1 और O3 जैसे तर्क मॉडल के लिए, TTFT में एक विस्तारित सोच चरण शामिल है जो समस्या की जटिलता के आधार पर 2 से 30 सेकंड तक चल सकता है। यह सोचने का समय आउटपुट टोकन दर पर चार्ज किया जाता है लेकिन स्ट्रीम की गई प्रतिक्रिया में दिखाई नहीं देता है। एक अनुरोध जो 200 दृश्यमान आउटपुट टोकन उत्पन्न करता है, उसने 2,000 से 5,000 सोच टोकन का उपभोग किया हो सकता है, जिससे विलंबता जुर्माना और छिपी हुई लागत गुणक दोनों बन जाते हैं। तर्क मॉडल का उपयोग केवल उन कार्यों के लिए किया जाना चाहिए जहां सोचने का समय मापनीय रूप से बेहतर परिणाम देता है।
वैश्विक सीडीएन या एपीआई गेटवे के पीछे एलएलएम तैनात करते समय, जोड़ा गया नेटवर्क चालू हो जाता है
वैश्विक सीडीएन या एपीआई गेटवे के पीछे एलएलएम तैनात करते समय, जोड़े गए नेटवर्क हॉप्स प्रति अनुरोध 10 से 50 एमएस अतिरिक्त विलंबता पेश करते हैं। व्यक्तिगत रूप से छोटा होते हुए भी, यह ओवरहेड एजेंट अनुप्रयोगों में संयोजित होता है जो 5 से 15 अनुक्रमिक एलएलएम कॉल करता है। 10 अनुक्रमिक कॉल वाली एक एजेंट पाइपलाइन अकेले 100 से 500ms गेटवे ओवरहेड जमा करती है। विलंबता-संवेदनशील एजेंट अनुप्रयोगों के लिए, ऑर्केस्ट्रेटर और एलएलएम एपीआई एंडपॉइंट के बीच नेटवर्क हॉप्स को कम करें।
फ़ंक्शन कॉलिंग और टूल का उपयोग विलंबता जोड़ता है क्योंकि मॉडल को उत्पन्न करना होगा
फ़ंक्शन कॉलिंग और टूल का उपयोग विलंबता जोड़ता है क्योंकि मॉडल को संरचित JSON आउटपुट (जो प्राकृतिक भाषा की तुलना में धीमा है) उत्पन्न करना होगा और फिर जारी रखने से पहले टूल परिणाम की प्रतीक्षा करनी होगी। प्रत्येक टूल कॉल राउंड-ट्रिप पूर्ण टीटीएफटी प्लस टूल निष्पादन समय जोड़ती है। 3 टूल कॉल करने वाला एक एजेंट लगभग 1 से 3 सेकंड एलएलएम विलंबता और बाहरी टूल प्रतिक्रिया समय जोड़ता है। जहां संभव हो, एकल टूल कॉल में एकाधिक क्वेरीज़ को बैच करके राउंड-ट्रिप को कम करने के लिए टूल इंटरफ़ेस डिज़ाइन करें।
एलएलएम विलंबता बेंचमार्क (2025 माध्य मान)
▾
| नमूना | टीटीएफटी (माध्यिका) | टोकन/सेकंड | 200-टोकन प्रतिक्रिया | 500-टोकन प्रतिक्रिया |
|---|---|---|---|---|
| GPT-4o | 350ms | 100 टोक/से | 2.35 सेकेंड | 5.35 सेकेंड |
| GPT-4o-मिनी | 150ms | 130 टोक/से | 1.69 सेकेंड | 4.00s |
| क्लाउड सॉनेट 4 | 500ms | 80 टोक/से | 3.00s | 6.75 सेकेंड |
| क्लाउड हाइकु | 200 मि.से | 120 टोक/से | 1.87 सेकेंड | 4.37 सेकेंड |
| जेमिनी 1.5 फ़्लैश | 200 मि.से | 140 टोक/से | 1.63 सेकेंड | 3.77 सेकेंड |
| o1 (तर्क) | 3,000ms | 50 टोक/से | 7.00s | 13.00s |
| लामा 3 70बी (एच100) | 100ms | 90 टोक/से | 2.32 सेकेंड | 5.66 सेकेंड |
अक्सर पूछे जाने वाले प्रश्न
▾
किस एलएलएम में सबसे कम विलंबता है?
प्रमुख वाणिज्यिक मॉडलों में, GPT-4o-मिनी लगातार 100 से 200ms TTFT और 120 से 150 टोकन प्रति सेकंड के साथ सबसे कम विलंबता प्रदान करता है। क्लाउड हाइकू भी इसी तरह तेज़ है। प्रमुख मॉडलों में, GPT-4o क्लाउड सॉनेट 4 की तुलना में थोड़ा तेज़ है। आंतरिक सोच के कारण O1 जैसे रीज़निंग मॉडल 2 से 10 सेकंड के TTFT के साथ काफी धीमे हैं। H100 GPU पर स्व-होस्ट किए गए मॉडल सब-100ms TTFT प्राप्त कर सकते हैं लेकिन इसके लिए महत्वपूर्ण बुनियादी ढांचे के निवेश की आवश्यकता होती है।
शीघ्र लंबाई विलंबता को कैसे प्रभावित करती है?
लंबे इनपुट संकेत टीटीएफटी को बढ़ाते हैं क्योंकि मॉडल को पहला आउटपुट टोकन उत्पन्न करने से पहले सभी इनपुट टोकन को संसाधित करना होगा। 1,000 इनपुट टोकन को संसाधित करने में आमतौर पर न्यूनतम संकेत की तुलना में 100 से 300 एमएस जुड़ जाते हैं। 10,000 इनपुट टोकन को संसाधित करने से 500 से 1,500 एमएस जुड़ सकते हैं। यही कारण है कि बड़े पुनर्प्राप्त संदर्भ वाले आरएजी अनुप्रयोगों में साधारण चैटबॉट इंटरैक्शन की तुलना में अधिक विलंबता होती है। प्रॉम्प्ट कैशिंग (एंथ्रोपिक से उपलब्ध) बार-बार प्रॉम्प्ट उपसर्गों के लिए इस प्रसंस्करण समय को समाप्त कर देता है।
क्या मुझे सभी एपीआई कॉल के लिए स्ट्रीमिंग का उपयोग करना चाहिए?
स्ट्रीमिंग का उपयोग किसी भी उपयोगकर्ता-सामना वाली प्रतिक्रिया के लिए किया जाना चाहिए जिसे उत्पन्न होने में 1 सेकंड से अधिक समय लगता है। प्रोग्रामेटिक एपीआई कॉल के लिए जहां आउटपुट को उपयोगकर्ताओं को प्रदर्शित करने के बजाय कोड द्वारा संसाधित किया जाता है, गैर-स्ट्रीमिंग सरल है और इसमें नगण्य विलंबता लाभ होता है। स्ट्रीमिंग अधिकांश एसडीके के साथ न्यूनतम कोड जटिलता जोड़ती है और बिना किसी अतिरिक्त लागत के सभी प्रमुख प्रदाताओं द्वारा समर्थित है। स्ट्रीमिंग से अनुमानित विलंबता में सुधार पर्याप्त है: स्ट्रीम होने पर 10-सेकंड की प्रतिक्रिया 1 सेकंड की तरह महसूस होती है।
मैं अपने आवेदन के लिए टीटीएफटी कैसे कम करूं?
प्रमुख टीटीएफटी अनुकूलन में शामिल हैं: बार-बार प्रॉम्प्ट उपसर्गों की प्रोसेसिंग को छोड़ने के लिए प्रॉम्प्ट कैशिंग का उपयोग करना (200 से 500 एमएस बचाता है), भौगोलिक रूप से करीब एपीआई एंडपॉइंट चुनना (50 से 200 एमएस नेटवर्क राउंड-ट्रिप बचाता है), इनपुट प्रॉम्प्ट लंबाई कम करना (100 से 500 एमएस बचाता है), और जीपीटी-4ओ-मिनी जैसे तेज़ मॉडल का उपयोग करना (100 से 300 एमएस बनाम बचाता है) GPT-4o). स्व-होस्ट किए गए मॉडल के लिए, वीएलएलएम जैसे अनुकूलित सर्विंग फ्रेमवर्क के साथ जीपीयू-त्वरित अनुमान उप-100 एमएस टीएफटी प्राप्त कर सकता है।
विभिन्न एप्लिकेशन प्रकारों के लिए स्वीकार्य विलंबता क्या है?
खोजें और स्वत: पूर्ण: 500 एमएस से कम। चैटबॉट प्रतिक्रियाएँ: 3 सेकंड से कम (स्ट्रीमिंग के साथ)। सामग्री निर्माण: 10 सेकंड से कम (स्ट्रीमिंग प्रगति संकेतक के साथ)। बैच प्रसंस्करण: मिनटों से घंटों तक (कोई विलंबता आवश्यकता नहीं)। वॉयस असिस्टेंट: कुल पाइपलाइन 2 सेकंड से कम। कोड पूर्णता: इनलाइन सुझावों के लिए 500 एमएस से कम। ये सीमाएँ उपयोगकर्ता अनुभव अनुसंधान और प्रतिस्पर्धी बेंचमार्क पर आधारित हैं।
सामान्य गलतियां जिनसे बचना है
▾
- !विलंबता प्रभाव को नजरअंदाज करते हुए केवल टोकन लागत के लिए अनुकूलन:
- !लंबी प्रतिक्रियाओं के लिए स्ट्रीमिंग का उपयोग न करना:
- !TTFT वेरिएंस और P99 विलंबता को अनदेखा करना:
विशेष टिप
अपनी संपूर्ण अनुरोध पाइपलाइन के लिए विलंबता बजट लागू करें और इसे सभी घटकों में आवंटित करें। 3-सेकंड के चैटबॉट बजट के लिए: नेटवर्क और प्रीप्रोसेसिंग के लिए 200ms, RAG पुनर्प्राप्ति के लिए 200ms, TTFT के लिए 300ms, और टोकन जेनरेशन के लिए 2,300ms (GPT-4o-मिनी पर 130 टोकन पर लगभग 300 टोकन की अनुमति)। यह बजट दृष्टिकोण व्यक्तिगत घटकों को उनके हिस्से से अधिक उपभोग करने से रोकता है और जब किसी घटक को अनुकूलन की आवश्यकता होती है या तेज़ मॉडल की आवश्यकता होती है तो उस पर प्रकाश डाला जाता है।
क्या आप जानते हैं?
मानव वार्तालाप में एक व्यक्ति द्वारा बोलना समाप्त करने और दूसरे द्वारा बोलना शुरू करने के बीच लगभग 200 मिलीसेकेंड का प्राकृतिक अंतराल होता है। जब एआई चैटबॉट प्रतिक्रिया समय 3 सेकंड से अधिक हो जाता है, तो उपयोगकर्ता अनजाने में 'बातचीत' मानसिक मॉडल के बजाय 'वेब खोज' मानसिक मॉडल अपनाते हैं, जिससे कम व्यस्त हो जाते हैं और छोड़ने की अधिक संभावना होती है। 2-सेकंड से कम प्रतिक्रिया प्राप्त करने से उपयोगकर्ता बातचीत की मानसिकता में बने रहते हैं, जिससे सहभागिता और संतुष्टि स्कोर दोनों में 25 से 40 प्रतिशत की वृद्धि होती है।
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
संदर्भ
साप्ताहिक गणित युक्तियाँ प्राप्त करें
12,000+ सब्सक्राइबर्स से जुड़ें जिन्हें हर हफ्ते कैलकुलेटर टिप्स मिलते हैं।