Skip to content
Skip to main content
DigiCalcs

ವಿಶೇಷ

LLM Latency Cost Calculator

What is LLM Latency Cost Calculator?

▾

LLM ಲೇಟೆನ್ಸಿ ಕಾಸ್ಟ್ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಡೆವಲಪರ್‌ಗಳಿಗೆ ಸಮಯದಿಂದ ಮೊದಲ ಟೋಕನ್ (TTFT), ಟೋಕನ್‌ಗಳು-ಪ್ರತಿ-ಸೆಕೆಂಡ್ ಥ್ರೋಪುಟ್ ಮತ್ತು ವಿವಿಧ ಮಾದರಿಗಳು ಮತ್ತು ಕಾನ್ಫಿಗರೇಶನ್‌ಗಳಾದ್ಯಂತ ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವನ್ನು ಮಾಡೆಲಿಂಗ್ ಮಾಡುವ ಮೂಲಕ AI ಅಪ್ಲಿಕೇಶನ್‌ಗಳಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯದ ಗುಪ್ತ ವೆಚ್ಚವನ್ನು ಪ್ರಮಾಣೀಕರಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಹೆಚ್ಚಿನ ವೆಚ್ಚದ ಚರ್ಚೆಗಳು ಟೋಕನ್ ಬೆಲೆಯ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದಾಗ, ಸುಪ್ತತೆಯು ತನ್ನದೇ ಆದ ಆರ್ಥಿಕ ಪರಿಣಾಮವನ್ನು ಹೊಂದಿದೆ: ನಿಧಾನವಾದ ಪ್ರತಿಕ್ರಿಯೆಗಳು ಬಳಕೆದಾರರ ತ್ಯಜಿಸುವಿಕೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ, ಥ್ರೋಪುಟ್ ಸಾಮರ್ಥ್ಯವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು AI-ಚಾಲಿತ ವೈಶಿಷ್ಟ್ಯಗಳ ಗ್ರಹಿಸಿದ ಗುಣಮಟ್ಟವನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ. ಮಾದರಿಗಳು ಮತ್ತು ಪೂರೈಕೆದಾರರಾದ್ಯಂತ ಸುಪ್ತತೆಯು ನಾಟಕೀಯವಾಗಿ ಬದಲಾಗುತ್ತದೆ. GPT-4o ಸಾಮಾನ್ಯವಾಗಿ 200 ರಿಂದ 500 ಮಿಲಿಸೆಕೆಂಡ್‌ಗಳಲ್ಲಿ ಸಮಯದಿಂದ ಮೊದಲ ಟೋಕನ್ ಅನ್ನು ನೀಡುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 80 ರಿಂದ 120 ಟೋಕನ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. GPT-4o-mini 100 ರಿಂದ 300ms TTFT ಮತ್ತು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 100 ರಿಂದ 150 ಟೋಕನ್‌ಗಳಲ್ಲಿ ವೇಗವಾಗಿರುತ್ತದೆ. ಕ್ಲೌಡ್ ಸಾನೆಟ್ 4 ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 70 ರಿಂದ 100 ಟೋಕನ್‌ಗಳೊಂದಿಗೆ 300 ರಿಂದ 700ms TTFT ವರೆಗೆ ಇರುತ್ತದೆ. ಈ ವ್ಯತ್ಯಾಸಗಳ ಪ್ರಕಾರ 500-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆಯು ಮಾದರಿ ಆಯ್ಕೆಯನ್ನು ಅವಲಂಬಿಸಿ 3 ರಿಂದ 7 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ, ಬಳಕೆದಾರರ ಅನುಭವ ಮತ್ತು ಅಪ್ಲಿಕೇಶನ್ ವಿನ್ಯಾಸವನ್ನು ನೇರವಾಗಿ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. ಈ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ನೇರ API ವೆಚ್ಚಗಳು, ಸಂಪರ್ಕಗಳನ್ನು ತೆರೆದಿರುವ ಮೂಲಸೌಕರ್ಯ ವೆಚ್ಚಗಳು, ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯದೊಂದಿಗೆ ಪರಸ್ಪರ ಸಂಬಂಧ ಹೊಂದಿರುವ ಬಳಕೆದಾರರ ಡ್ರಾಪ್-ಆಫ್ ದರಗಳು ಮತ್ತು ಅದೇ ವಿನಂತಿಯ ಪರಿಮಾಣವನ್ನು ಪೂರೈಸಲು ಹೆಚ್ಚು ಏಕಕಾಲಿಕ ಸಂಪರ್ಕಗಳ ಅಗತ್ಯವಿರುವ ನಿಧಾನಗತಿಯ ಮಾದರಿಗಳ ಥ್ರೋಪುಟ್ ಪರಿಣಾಮಗಳನ್ನು ಒಳಗೊಂಡಂತೆ ಸುಪ್ತತೆಯ ಒಟ್ಟು ವೆಚ್ಚವನ್ನು ರೂಪಿಸುತ್ತದೆ. ಚಾಟ್‌ಬಾಟ್‌ಗಳು ಮತ್ತು ಹುಡುಕಾಟದಂತಹ ನೈಜ-ಸಮಯದ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗಾಗಿ, ಲೇಟೆನ್ಸಿ ಆಪ್ಟಿಮೈಸೇಶನ್ ಒಟ್ಟಾರೆ ಸಿಸ್ಟಂ ಅರ್ಥಶಾಸ್ತ್ರಕ್ಕೆ ಟೋಕನ್ ವೆಚ್ಚ ಆಪ್ಟಿಮೈಸೇಶನ್‌ನಂತೆಯೇ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ.

DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.

ಸೂತ್ರ

▾
f(x)ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ = ಮೊದಲ ಟೋಕನ್‌ಗೆ ಸಮಯ + (ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳು / ಟೋಕನ್‌ಗಳು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ). ಪ್ರತಿ ವಿನಂತಿಗೆ ಪರಿಣಾಮಕಾರಿ ವೆಚ್ಚ = API ಟೋಕನ್ ವೆಚ್ಚ + (ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ / 3600) x ಪ್ರತಿ ಗಂಟೆಗೆ ಸರ್ವರ್ ಸಂಪರ್ಕದ ವೆಚ್ಚ + ಡ್ರಾಪ್-ಆಫ್ ಸಂಭವನೀಯತೆ x ಪ್ರತಿ ಬಳಕೆದಾರರಿಗೆ ಕಳೆದುಹೋದ ಆದಾಯ. ಉದಾಹರಣೆಗೆ: 100 tok/s ನಲ್ಲಿ 400ms TTFT + 300 ಟೋಕನ್‌ಗಳು = 400ms + 3,000ms = 3.4 ಸೆಕೆಂಡುಗಳ ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ.

Variable Legend

▾
ಚಿಹ್ನೆಹೆಸರುಘಟಕವಿವರಣೆ
TTFTಮೊದಲ ಟೋಕನ್‌ಗೆ ಸಮಯmillisecondsAPI ವಿನಂತಿಯನ್ನು ಕಳುಹಿಸುವ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆಯ ಮೊದಲ ಟೋಕನ್ ಅನ್ನು ಸ್ವೀಕರಿಸುವ ನಡುವಿನ ವಿಳಂಬ, ಇದು ಕನಿಷ್ಠ ಗ್ರಹಿಸಿದ ಸುಪ್ತತೆಯನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ.
TPSಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಟೋಕನ್‌ಗಳುtokens per secondಮೊದಲ ಟೋಕನ್ ನಂತರ ಪೀಳಿಗೆಯ ವೇಗ, ಪೂರ್ಣ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಎಷ್ಟು ಬೇಗನೆ ಉತ್ಪಾದಿಸಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ, ಸಾಮಾನ್ಯವಾಗಿ ಪ್ರಮಾಣಿತ ಮಾದರಿಗಳಿಗೆ 80 ರಿಂದ 150.
T_outಔಟ್ಪುಟ್ ಟೋಕನ್ ಎಣಿಕೆtokensಮಾದರಿ ಪ್ರತಿಕ್ರಿಯೆಯಲ್ಲಿನ ಟೋಕನ್‌ಗಳ ಸಂಖ್ಯೆ, ಪೀಳಿಗೆಯ ವೇಗದಿಂದ ಗುಣಿಸಿದಾಗ TTFT ನಂತರ ಸ್ಟ್ರೀಮಿಂಗ್ ಅವಧಿಯನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ.
Dಡ್ರಾಪ್-ಆಫ್ ದರratio per second of latencyಪ್ರತಿ ಸೆಕೆಂಡ್‌ಗೆ ಪ್ರತಿ ಸೆಕೆಂಡ್‌ಗೆ ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 5 ರಿಂದ 15 ಪ್ರತಿಶತದಷ್ಟು 3-ಸೆಕೆಂಡ್ ಥ್ರೆಶೋಲ್ಡ್‌ಗಿಂತ ಹೆಚ್ಚಿನ ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಪರಸ್ಪರ ಕ್ರಿಯೆಯನ್ನು ತ್ಯಜಿಸುವ ಬಳಕೆದಾರರ ಅಂದಾಜು ಭಾಗ.
V_userಕಳೆದುಹೋದ ಬಳಕೆದಾರರಿಗೆ ಮೌಲ್ಯUSDಮಿತಿಮೀರಿದ ಸುಪ್ತತೆಯಿಂದಾಗಿ AI ಪರಸ್ಪರ ಕ್ರಿಯೆಯನ್ನು ಬಳಕೆದಾರರು ತ್ಯಜಿಸಿದಾಗ ಅಂದಾಜು ಆದಾಯ ಅಥವಾ ಗ್ರಾಹಕ ಮೌಲ್ಯವು ಕಳೆದುಹೋಗುತ್ತದೆ.

How to LLM Latency Cost Calculator

▾
  1. 1ನೀವು ಆಯ್ಕೆ ಮಾಡಿದ ಮಾದರಿ ಮತ್ತು ಕಾನ್ಫಿಗರೇಶನ್‌ಗಾಗಿ ಸಮಯದಿಂದ ಮೊದಲ ಟೋಕನ್ (TTFT) ಅನ್ನು ಅಳೆಯಿರಿ ಅಥವಾ ಅಂದಾಜು ಮಾಡಿ. TTFT ಎಂಬುದು API ವಿನಂತಿಯನ್ನು ಕಳುಹಿಸುವ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆಯ ಮೊದಲ ಟೋಕನ್ ಅನ್ನು ಸ್ವೀಕರಿಸುವ ನಡುವಿನ ವಿಳಂಬವಾಗಿದೆ. ಇದು ಮಾದರಿಯ ಸಂಕೀರ್ಣತೆ, ಇನ್‌ಪುಟ್ ಪ್ರಾಂಪ್ಟ್ ಉದ್ದ, ಸರ್ವರ್ ಲೋಡ್ ಮತ್ತು API ಎಂಡ್‌ಪಾಯಿಂಟ್‌ಗೆ ಭೌಗೋಳಿಕ ಅಂತರವನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ. GPT-4o TTFT 200 ರಿಂದ 500ms ವರೆಗೆ ಇರುತ್ತದೆ, ಆದರೆ o1 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳು ಆರಂಭಿಕ ಚಿಂತನೆಯ ಹಂತಕ್ಕೆ 2 ರಿಂದ 10 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಬಹುದು.
  2. 2ನಿಮ್ಮ ಮಾದರಿಗಾಗಿ ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಟೋಕನ್‌ಗಳ ಪೀಳಿಗೆಯ ದರವನ್ನು ನಿರ್ಧರಿಸಿ. ಮೊದಲ ಟೋಕನ್ ಬಂದ ನಂತರ ಮಾದರಿಯು ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ವೇಗ ಇದು. ಪ್ರಮಾಣಿತ ಮಾದರಿಗಳು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 80 ರಿಂದ 150 ಟೋಕನ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತವೆ. ದೀರ್ಘವಾದ ಔಟ್‌ಪುಟ್‌ಗಳು ಪ್ರಮಾಣಾನುಗುಣವಾಗಿ ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುತ್ತವೆ: ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 100 ಟೋಕನ್‌ಗಳಲ್ಲಿ 500-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆಯು TTFT ನಂತರ 5 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. ಬಳಕೆದಾರರಿಗೆ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಸ್ಟ್ರೀಮ್ ಮಾಡುವುದರಿಂದ ಅವರು ಬಂದಂತೆ ಟೋಕನ್‌ಗಳನ್ನು ತೋರಿಸುವ ಮೂಲಕ ಗ್ರಹಿಸಿದ ಸುಪ್ತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
  3. 3ನಿಮ್ಮ ವಿಶಿಷ್ಟ ಔಟ್‌ಪುಟ್ ಉದ್ದಗಳಿಗಾಗಿ ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವನ್ನು ಲೆಕ್ಕಹಾಕಿ. GPT-4o ನಲ್ಲಿ 200-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಹೊಂದಿರುವ ಚಾಟ್‌ಬಾಟ್‌ಗಾಗಿ: TTFT (350ms) + ಜನರೇಷನ್ (200 ಟೋಕನ್‌ಗಳು / 100 tok/s = 2,000ms) = 2.35 ಸೆಕೆಂಡುಗಳು. 1,000-ಟೋಕನ್ ಔಟ್‌ಪುಟ್‌ಗಳೊಂದಿಗೆ ವಿಷಯ ರಚನೆ ವೈಶಿಷ್ಟ್ಯಕ್ಕಾಗಿ: TTFT (350ms) + ಜನರೇಷನ್ (10,000ms) = 10.35 ಸೆಕೆಂಡುಗಳು. ವೈಶಿಷ್ಟ್ಯವು ಬಳಕೆದಾರರಿಗೆ ಸ್ಪಂದಿಸುತ್ತದೆಯೇ ಅಥವಾ ನಿಧಾನವಾಗಿರುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ಈ ಸಮಯಗಳು ನಿರ್ಧರಿಸುತ್ತವೆ.
  4. 4ಲೇಟೆನ್ಸಿಯ ಬಳಕೆದಾರರ ಅನುಭವದ ಪ್ರಭಾವವನ್ನು ಮಾದರಿ ಮಾಡಿ. ಬಳಕೆದಾರರ ತೃಪ್ತಿಯು 3-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯಕ್ಕಿಂತ ಗಮನಾರ್ಹವಾಗಿ ಇಳಿಯುತ್ತದೆ ಎಂದು ಸಂಶೋಧನೆ ತೋರಿಸುತ್ತದೆ. ಚಾಟ್‌ಬಾಟ್‌ಗಳಿಗೆ, 5 ಸೆಕೆಂಡ್‌ಗಳ ಮೇಲಿನ ಪ್ರತಿಕ್ರಿಯೆಗಳು 20 ರಿಂದ 30 ಪ್ರತಿಶತದಷ್ಟು ಬಳಕೆದಾರರು ಸಂಭಾಷಣೆಯನ್ನು ತ್ಯಜಿಸಲು ಕಾರಣವಾಗುತ್ತವೆ. ಹುಡುಕಾಟ ವೈಶಿಷ್ಟ್ಯಗಳಿಗಾಗಿ, 2 ಸೆಕೆಂಡುಗಳಿಗಿಂತ ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುವ ಫಲಿತಾಂಶಗಳು 10 ರಿಂದ 15 ಪ್ರತಿಶತ ಕಡಿಮೆ ನಿಶ್ಚಿತಾರ್ಥವನ್ನು ನೋಡಿ. ಕ್ಯಾಲ್ಕುಲೇಟರ್ ನಿಮ್ಮ ಪರಿವರ್ತನೆ ದರಗಳು ಮತ್ತು ಬಳಕೆದಾರರ ಜೀವಿತಾವಧಿಯ ಮೌಲ್ಯವನ್ನು ಆಧರಿಸಿ ಕಳೆದುಹೋದ ನಿಶ್ಚಿತಾರ್ಥಕ್ಕೆ ಡಾಲರ್ ಮೌಲ್ಯವನ್ನು ನಿಯೋಜಿಸುತ್ತದೆ.
  5. 5ಥ್ರೋಪುಟ್ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಅದರ ವೆಚ್ಚದ ಪರಿಣಾಮಗಳನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ. ಸ್ಟ್ರೀಮಿಂಗ್ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಸರ್ವರ್ ಪೂರ್ಣ ಪ್ರತಿಕ್ರಿಯೆ ಅವಧಿಯವರೆಗೆ ಸಂಪರ್ಕಗಳನ್ನು ತೆರೆದಿರಬೇಕು. ಪ್ರತಿ ಪ್ರತಿಕ್ರಿಯೆಯು 5 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಂಡರೆ, ಒಂದು ಸರ್ವರ್ ಥ್ರೆಡ್ ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ 12 ವಿನಂತಿಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ. 2 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯಿಸುವ ವೇಗದ ಮಾದರಿಗೆ ಬದಲಾಯಿಸುವುದರಿಂದ ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ 30 ವಿನಂತಿಗಳಿಗೆ ಥ್ರೋಪುಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ, ಅದೇ ಟ್ರಾಫಿಕ್‌ಗೆ 60 ಪ್ರತಿಶತ ಕಡಿಮೆ ಸರ್ವರ್ ಸಂಪನ್ಮೂಲಗಳು ಬೇಕಾಗುತ್ತವೆ. ಈ ಮೂಲಸೌಕರ್ಯ ಉಳಿತಾಯವು ಮಾದರಿಗಳ ನಡುವಿನ API ವೆಚ್ಚದ ವ್ಯತ್ಯಾಸವನ್ನು ಮೀರಬಹುದು.
  6. 6ಟೋಕನ್ ಬೆಲೆ ಮತ್ತು ಲೇಟೆನ್ಸಿ ವೆಚ್ಚಗಳನ್ನು ಒಳಗೊಂಡಂತೆ ಮಾದರಿ ಆಯ್ಕೆಗಳಾದ್ಯಂತ ಒಟ್ಟು ವೆಚ್ಚವನ್ನು ಹೋಲಿಕೆ ಮಾಡಿ. ಮೂಲಸೌಕರ್ಯ, ಬಳಕೆದಾರರ ಡ್ರಾಪ್-ಆಫ್ ಮತ್ತು ಥ್ರೋಪುಟ್ ನಿರ್ಬಂಧಗಳನ್ನು ಲೆಕ್ಕಹಾಕುವಾಗ ನಿಧಾನವಾದ ಪ್ರತಿ ಟೋಕನ್ ಮಾದರಿಯು ಹೆಚ್ಚು ವೆಚ್ಚವಾಗಬಹುದು. ಕ್ಯಾಲ್ಕುಲೇಟರ್ API ವೆಚ್ಚ, ಸರ್ವರ್ ವೆಚ್ಚ ಮತ್ತು ಸುಪ್ತತೆಯಿಂದ ಅಂದಾಜು ಆದಾಯದ ಪ್ರಭಾವವನ್ನು ಒಳಗೊಂಡಿರುವ ಒಟ್ಟು ಆರ್ಥಿಕ ಹೋಲಿಕೆಯನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.
  7. 7ಕಾನ್ಫಿಗರೇಶನ್ ಬದಲಾವಣೆಗಳ ಮೂಲಕ ಸುಪ್ತತೆಯನ್ನು ಆಪ್ಟಿಮೈಜ್ ಮಾಡಿ. max_tokens ನೊಂದಿಗೆ ಔಟ್‌ಪುಟ್ ಟೋಕನ್ ಮಿತಿಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು, ಗ್ರಹಿಸಿದ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಸುಧಾರಿಸಲು ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಬಳಸುವುದು, TTFT ಅನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಅನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸುವುದು ಮತ್ತು ಭೌಗೋಳಿಕವಾಗಿ ಹತ್ತಿರವಿರುವ API ಅಂತಿಮ ಬಿಂದುಗಳನ್ನು ಆರಿಸುವುದರಿಂದ ಪ್ರತಿಯೊಂದೂ ಮಾದರಿಗಳನ್ನು ಬದಲಾಯಿಸದೆಯೇ 20 ರಿಂದ 50 ಪ್ರತಿಶತದಷ್ಟು ಸುಪ್ತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಪ್ರತಿ ಆಪ್ಟಿಮೈಸೇಶನ್‌ನ ವೆಚ್ಚದ ಪ್ರಭಾವವನ್ನು ರೂಪಿಸುತ್ತದೆ.

Worked Examples

▾
Example 1ಚಾಟ್‌ಬಾಟ್ ಸುಪ್ತತೆ ಹೋಲಿಕೆ
Given:['GPT-4o', 'GPT-4o-mini', 'Claude Sonnet 4'], 200, [350, 150, 500], [100, 130, 80]
ಫಲಿತಾಂಶ:GPT-4o: 2.35s, GPT-4o-mini: 1.69s, Claude Sonnet 4: 3.0s

3-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಗಳ ಅಡಿಯಲ್ಲಿ ಟಾರ್ಗೆಟ್ ಮಾಡುವ ಚಾಟ್‌ಬಾಟ್‌ಗಾಗಿ, GPT-4o ಮತ್ತು GPT-4o-mini ಎರಡೂ ಮಿತಿಯನ್ನು ಪೂರೈಸುತ್ತವೆ ಆದರೆ Claude Sonnet 4 ಗಡಿರೇಖೆಯಾಗಿದೆ. GPT-4o-mini GPT-4o ಗಿಂತ 28 ಪ್ರತಿಶತ ವೇಗವಾಗಿದೆ ಮತ್ತು 94 ಪ್ರತಿಶತ ಅಗ್ಗವಾಗಿದೆ, ಇದು ಹೆಚ್ಚಿನ ಚಾಟ್‌ಬಾಟ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗೆ ಅತ್ಯುತ್ತಮ ಆಯ್ಕೆಯಾಗಿದೆ.

Example 2ಕಂಟೆಂಟ್ ಜನರೇಷನ್ ಥ್ರೋಪುಟ್ ಅನಾಲಿಸಿಸ್
Given:GPT-4o, 1000, 400, 100, 50, 5.0
ಫಲಿತಾಂಶ:ಪ್ರತಿ ಪ್ರತಿಕ್ರಿಯೆಗೆ 10.4ಸೆ, ಪ್ರತಿ ಥ್ರೆಡ್‌ಗೆ 5.8 req/min, 50 ಏಕಕಾಲೀನ ಬಳಕೆದಾರರಿಗೆ 9 ಥ್ರೆಡ್‌ಗಳ ಅಗತ್ಯವಿದೆ

ಪ್ರತಿ 1,000-ಟೋಕನ್ ಪೀಳಿಗೆಯು 10.4 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. 50 ಏಕಕಾಲೀನ ಬಳಕೆದಾರರಿಗೆ ಸೇವೆ ಸಲ್ಲಿಸಲು, ನಿಮಗೆ ಸರಿಸುಮಾರು 9 ಸರ್ವರ್ ಥ್ರೆಡ್‌ಗಳನ್ನು ಹೊಂದಿರುವ ಸಂಪರ್ಕಗಳನ್ನು ತೆರೆದಿರಬೇಕು. ಸರ್ವರ್ ಮೂಲಸೌಕರ್ಯಕ್ಕೆ ಪ್ರತಿ ಗಂಟೆಗೆ $5, ಥ್ರೋಪುಟ್ ವೆಚ್ಚವು API ಟೋಕನ್ ವೆಚ್ಚದ ಮೇಲೆ ಪ್ರತಿ ವಿನಂತಿಗೆ $0.0024 ಅನ್ನು ಸೇರಿಸುತ್ತದೆ.

Example 3ಕಟ್ಟುನಿಟ್ಟಾದ ಲೇಟೆನ್ಸಿ ಬಜೆಟ್‌ನೊಂದಿಗೆ ಹುಡುಕಾಟ ವೈಶಿಷ್ಟ್ಯ
Given:2000, 200, 1800, GPT-4o-ಮಿನಿ, 150, 130
ಫಲಿತಾಂಶ:ಗರಿಷ್ಠ ಔಟ್‌ಪುಟ್: 2-ಸೆಕೆಂಡ್ ಬಜೆಟ್‌ನಲ್ಲಿ 214 ಟೋಕನ್‌ಗಳು

ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ 200ms ಮತ್ತು 150ms TTFT ನಂತರ, ಟೋಕನ್ ಉತ್ಪಾದನೆಗೆ 1,450ms ಉಳಿದಿವೆ. ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 130 ಟೋಕನ್‌ಗಳಲ್ಲಿ, ಗರಿಷ್ಠ ಔಟ್‌ಪುಟ್ 188 ಟೋಕನ್‌ಗಳು. ವೈಶಿಷ್ಟ್ಯಕ್ಕೆ ದೀರ್ಘವಾದ ಪ್ರತಿಕ್ರಿಯೆಗಳ ಅಗತ್ಯವಿದ್ದರೆ, ಲೇಟೆನ್ಸಿ ಬಜೆಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸಬೇಕು ಅಥವಾ ವೇಗವಾದ ಮಾದರಿ ಅಥವಾ ಕಡಿಮೆ ಮರುಪಡೆಯುವಿಕೆ ಸಮಯ ಬೇಕಾಗುತ್ತದೆ.

Real-World Applications

▾
🏗️

AI-ಚಾಲಿತ ಉತ್ತರ ಉತ್ಪಾದನೆಯೊಂದಿಗೆ ಹುಡುಕಾಟ ಎಂಜಿನ್‌ಗಳು ಸಾಂಪ್ರದಾಯಿಕ ಹುಡುಕಾಟದಿಂದ ಹೊಂದಿಸಲಾದ ಬಳಕೆದಾರರ ನಿರೀಕ್ಷೆಗಳನ್ನು ಹೊಂದಿಸಲು 2 ರಿಂದ 3 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಫಲಿತಾಂಶಗಳನ್ನು ತಲುಪಿಸಬೇಕು. ಉತ್ತರ ಸಂಶ್ಲೇಷಣೆಗಾಗಿ GPT-4o ಅನ್ನು ಬಳಸುವ ಹುಡುಕಾಟ ವೇದಿಕೆಯು ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ 500ms ಮತ್ತು LLM ಉತ್ಪಾದನೆಗೆ 2,000ms ಬಜೆಟ್. ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 100 ಟೋಕನ್‌ಗಳಲ್ಲಿ, ಅವರು ಸುಪ್ತ ಬಜೆಟ್‌ನಲ್ಲಿ ಸರಿಸುಮಾರು 170 ಟೋಕನ್‌ಗಳನ್ನು (ಸುಮಾರು 130 ಪದಗಳು) ರಚಿಸಬಹುದು. ಈ ನಿರ್ಬಂಧವು ಗರಿಷ್ಠ ಉತ್ತರದ ಉದ್ದವನ್ನು ನಿರ್ದೇಶಿಸುತ್ತದೆ ಮತ್ತು ವೇಗವಾಗಿ ಲಭ್ಯವಿರುವ ಮಾದರಿಯ ಆಯ್ಕೆಯನ್ನು ಚಾಲನೆ ಮಾಡುತ್ತದೆ.

🔬

ನೈಜ-ಸಮಯದ ಅನುವಾದ ಸೇವೆಗಳು ಸಂವಾದದ ಹರಿವಿಗಾಗಿ ಸುಪ್ತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡಬೇಕು. GPT-4o-mini ಬಳಸುವ ಲೈವ್ ಅನುವಾದ ವೈಶಿಷ್ಟ್ಯವು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 150ms TTFT ಮತ್ತು 130 ಟೋಕನ್‌ಗಳನ್ನು ಸಾಧಿಸುತ್ತದೆ, ಒಟ್ಟು 0.77 ಸೆಕೆಂಡುಗಳಲ್ಲಿ 50-ಪದ ವಾಕ್ಯವನ್ನು (ಸುಮಾರು 80 ಟೋಕನ್‌ಗಳ ಔಟ್‌ಪುಟ್) ಅನುವಾದಿಸುತ್ತದೆ. ಈ ಉಪ-ಸೆಕೆಂಡ್ ಲೇಟೆನ್ಸಿ ನೈಸರ್ಗಿಕ ಸಂಭಾಷಣೆಯ ವೇಗವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ. ಬದಲಿಗೆ GPT-4o ಅನ್ನು ಬಳಸುವುದು 200ms TTFT ಅನ್ನು ಸೇರಿಸುತ್ತದೆ ಮತ್ತು ಥ್ರೋಪುಟ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಸಂಭಾಷಣೆಯ ಹರಿವನ್ನು ಮುರಿಯುವ ಗಮನಾರ್ಹ ವಿರಾಮಗಳನ್ನು ರಚಿಸುತ್ತದೆ.

📊

ವ್ಯಾಪಾರ ಮತ್ತು ಹಣಕಾಸು ವಿಶ್ಲೇಷಣಾ ವೇದಿಕೆಗಳು ನೈಜ-ಸಮಯದ ಮಾರುಕಟ್ಟೆ ವ್ಯಾಖ್ಯಾನ ಮತ್ತು ಎಚ್ಚರಿಕೆಯ ಉತ್ಪಾದನೆಗಾಗಿ LLM ಗಳನ್ನು ಬಳಸುತ್ತವೆ. ಸುಪ್ತತೆಯು ಮಾರುಕಟ್ಟೆ-ಚಲಿಸುವ ಮಾಹಿತಿಯ ಮೌಲ್ಯವನ್ನು ನೇರವಾಗಿ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. 100-ಟೋಕನ್ ಮಾರುಕಟ್ಟೆ ಎಚ್ಚರಿಕೆಗಳಿಗಾಗಿ GPT-4o-mini ಬಳಸುವ ಹಣಕಾಸು ವೇದಿಕೆಯು 1 ಸೆಕೆಂಡಿನೊಳಗೆ ವಿತರಣೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ, ಸಮಯ-ಸೂಕ್ಷ್ಮ ಹಣಕಾಸಿನ ಮಾಹಿತಿಯ ಅಗತ್ಯವನ್ನು ಪೂರೈಸುತ್ತದೆ. ಪ್ಲಾಟ್‌ಫಾರ್ಮ್ ದೀರ್ಘ ವಿಶ್ಲೇಷಣಾತ್ಮಕ ತುಣುಕುಗಳನ್ನು GPT-4o ಗೆ ದಾರಿ ಮಾಡುತ್ತದೆ, ಅಲ್ಲಿ ಸುಪ್ತತೆ ಕಡಿಮೆ ನಿರ್ಣಾಯಕವಾಗಿದೆ.

🏥

ಧ್ವನಿ ಸಹಾಯಕರು ಮತ್ತು ಧ್ವನಿ-ಸಕ್ರಿಯಗೊಳಿಸಿದ AI ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ಕಟ್ಟುನಿಟ್ಟಾದ ಲೇಟೆನ್ಸಿ ಬಜೆಟ್‌ಗಳನ್ನು ಹೊಂದಿವೆ ಏಕೆಂದರೆ ಬಳಕೆದಾರರು ತಕ್ಷಣದ ಮೌಖಿಕ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ನಿರೀಕ್ಷಿಸುತ್ತಾರೆ. ಸ್ಪೀಚ್-ಟು-ಟೆಕ್ಸ್ಟ್ (300 ರಿಂದ 500 ಎಂಎಸ್) ನಿಂದ ಎಲ್‌ಎಲ್‌ಎಂ ಪೀಳಿಗೆಯಿಂದ ಪಠ್ಯದಿಂದ ಭಾಷಣಕ್ಕೆ (200 ರಿಂದ 400 ಎಂಎಸ್) ಒಟ್ಟು ಪೈಪ್‌ಲೈನ್ 2 ರಿಂದ 3 ಸೆಕೆಂಡುಗಳ ಒಳಗೆ ಪೂರ್ಣಗೊಳ್ಳಬೇಕು. ಇದು LLM ಉತ್ಪಾದನೆಗೆ ಕೇವಲ 1 ರಿಂದ 2 ಸೆಕೆಂಡುಗಳನ್ನು ಬಿಟ್ಟು, ಮಾದರಿ ಆಯ್ಕೆ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆಯ ಉದ್ದವನ್ನು ನಿರ್ಬಂಧಿಸುತ್ತದೆ. ಅನೇಕ ಧ್ವನಿ ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ತಮ್ಮ ವೇಗವಾದ TTFT ಗಾಗಿ ನಿರ್ದಿಷ್ಟವಾಗಿ GPT-4o-mini ಅಥವಾ Claude Haiku ಅನ್ನು ಬಳಸುತ್ತವೆ.

Special Cases

▾

o1 ಮತ್ತು o3 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳಿಗಾಗಿ, TTFT ವಿಸ್ತೃತ ಚಿಂತನೆಯನ್ನು ಒಳಗೊಂಡಿದೆ

o1 ಮತ್ತು o3 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳಿಗಾಗಿ, TTFT ವಿಸ್ತೃತ ಚಿಂತನೆಯ ಹಂತವನ್ನು ಒಳಗೊಂಡಿದೆ, ಇದು ಸಮಸ್ಯೆಯ ಸಂಕೀರ್ಣತೆಯನ್ನು ಅವಲಂಬಿಸಿ 2 ರಿಂದ 30 ಸೆಕೆಂಡುಗಳವರೆಗೆ ಇರುತ್ತದೆ. ಈ ಚಿಂತನೆಯ ಸಮಯವನ್ನು ಔಟ್‌ಪುಟ್ ಟೋಕನ್ ದರದಲ್ಲಿ ವಿಧಿಸಲಾಗುತ್ತದೆ ಆದರೆ ಸ್ಟ್ರೀಮ್ ಮಾಡಿದ ಪ್ರತಿಕ್ರಿಯೆಯಲ್ಲಿ ಗೋಚರಿಸುವುದಿಲ್ಲ. 200 ಗೋಚರ ಔಟ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ವಿನಂತಿಯು 2,000 ರಿಂದ 5,000 ಥಿಂಕಿಂಗ್ ಟೋಕನ್‌ಗಳನ್ನು ಸೇವಿಸಿರಬಹುದು, ಇದು ಲೇಟೆನ್ಸಿ ಪೆನಾಲ್ಟಿ ಮತ್ತು ಗುಪ್ತ ವೆಚ್ಚ ಗುಣಕ ಎರಡನ್ನೂ ಸೃಷ್ಟಿಸುತ್ತದೆ. ಚಿಂತನೆಯ ಸಮಯವು ಅಳೆಯಬಹುದಾದ ಉತ್ತಮ ಫಲಿತಾಂಶಗಳನ್ನು ಉಂಟುಮಾಡುವ ಕಾರ್ಯಗಳಿಗಾಗಿ ಮಾತ್ರ ತಾರ್ಕಿಕ ಮಾದರಿಗಳನ್ನು ಬಳಸಬೇಕು.

ಜಾಗತಿಕ CDN ಅಥವಾ API ಗೇಟ್‌ವೇ ಹಿಂದೆ LLM ಗಳನ್ನು ನಿಯೋಜಿಸುವಾಗ, ಸೇರಿಸಲಾದ ನೆಟ್‌ವರ್ಕ್ ಹಾಪ್ ಆಗುತ್ತದೆ

ಜಾಗತಿಕ CDN ಅಥವಾ API ಗೇಟ್‌ವೇ ಹಿಂದೆ LLM ಗಳನ್ನು ನಿಯೋಜಿಸುವಾಗ, ಸೇರಿಸಲಾದ ನೆಟ್‌ವರ್ಕ್ ಹಾಪ್‌ಗಳು ಪ್ರತಿ ವಿನಂತಿಗೆ 10 ರಿಂದ 50ms ಹೆಚ್ಚುವರಿ ಲೇಟೆನ್ಸಿಯನ್ನು ಪರಿಚಯಿಸುತ್ತವೆ. ಪ್ರತ್ಯೇಕವಾಗಿ ಚಿಕ್ಕದಾಗಿದ್ದರೂ, 5 ರಿಂದ 15 ಅನುಕ್ರಮ LLM ಕರೆಗಳನ್ನು ಮಾಡುವ ಏಜೆಂಟ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಲ್ಲಿ ಈ ಓವರ್‌ಹೆಡ್ ಸಂಯುಕ್ತಗಳು. 10 ಅನುಕ್ರಮ ಕರೆಗಳನ್ನು ಹೊಂದಿರುವ ಏಜೆಂಟ್ ಪೈಪ್‌ಲೈನ್ 100 ರಿಂದ 500ms ಗೇಟ್‌ವೇ ಓವರ್‌ಹೆಡ್ ಅನ್ನು ಮಾತ್ರ ಸಂಗ್ರಹಿಸುತ್ತದೆ. ಲೇಟೆನ್ಸಿ-ಸೆನ್ಸಿಟಿವ್ ಏಜೆಂಟ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗಾಗಿ, ಆರ್ಕೆಸ್ಟ್ರೇಟರ್ ಮತ್ತು LLM API ಎಂಡ್‌ಪಾಯಿಂಟ್ ನಡುವೆ ನೆಟ್‌ವರ್ಕ್ ಹಾಪ್‌ಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಿ.

ಫಂಕ್ಷನ್ ಕರೆ ಮತ್ತು ಟೂಲ್ ಬಳಕೆಯು ಸುಪ್ತತೆಯನ್ನು ಸೇರಿಸುತ್ತದೆ ಏಕೆಂದರೆ ಮಾದರಿಯು ರಚಿಸಬೇಕು

ಫಂಕ್ಷನ್ ಕರೆ ಮತ್ತು ಟೂಲ್ ಬಳಕೆಯು ಸುಪ್ತತೆಯನ್ನು ಸೇರಿಸುತ್ತದೆ ಏಕೆಂದರೆ ಮಾದರಿಯು ರಚನಾತ್ಮಕ JSON ಔಟ್‌ಪುಟ್ ಅನ್ನು ರಚಿಸಬೇಕು (ಇದು ನೈಸರ್ಗಿಕ ಭಾಷೆಗಿಂತ ನಿಧಾನವಾಗಿರುತ್ತದೆ) ಮತ್ತು ನಂತರ ಮುಂದುವರೆಯುವ ಮೊದಲು ಟೂಲ್ ಫಲಿತಾಂಶಕ್ಕಾಗಿ ಕಾಯಿರಿ. ಪ್ರತಿಯೊಂದು ಟೂಲ್ ಕರೆ ರೌಂಡ್-ಟ್ರಿಪ್ ಪೂರ್ಣ TTFT ಜೊತೆಗೆ ಟೂಲ್ ಎಕ್ಸಿಕ್ಯೂಶನ್ ಸಮಯವನ್ನು ಸೇರಿಸುತ್ತದೆ. 3 ಟೂಲ್ ಕರೆಗಳನ್ನು ಮಾಡುವ ಏಜೆಂಟ್ ಸರಿಸುಮಾರು 1 ರಿಂದ 3 ಸೆಕೆಂಡುಗಳ LLM ಲೇಟೆನ್ಸಿ ಜೊತೆಗೆ ಬಾಹ್ಯ ಉಪಕರಣದ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವನ್ನು ಸೇರಿಸುತ್ತದೆ. ಸಾಧ್ಯವಿರುವಲ್ಲಿ ಒಂದೇ ಟೂಲ್ ಕರೆಗಳಲ್ಲಿ ಬಹು ಪ್ರಶ್ನೆಗಳನ್ನು ಬ್ಯಾಚ್ ಮಾಡುವ ಮೂಲಕ ರೌಂಡ್-ಟ್ರಿಪ್‌ಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಟೂಲ್ ಇಂಟರ್‌ಫೇಸ್‌ಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ.

LLM ಲೇಟೆನ್ಸಿ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು (2025 ಸರಾಸರಿ ಮೌಲ್ಯಗಳು)

▾
ಮಾದರಿTTFT (ಮಧ್ಯಮ)ಟೋಕನ್ಗಳು/ಸೆಕೆಂಡ್200-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆ500-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆ
GPT-4o350ms100 ಟೋಕ್/ಸೆ2.35 ಸೆ5.35ಸೆ
GPT-4o-ಮಿನಿ150 ಎಂಎಸ್130 ಟಾಕ್/ಸೆ1.69 ಸೆ4.00 ಸೆ
ಕ್ಲೌಡ್ ಸಾನೆಟ್ 4500ms80 tok/s3.00 ಸೆ6.75 ಸೆ
ಕ್ಲೌಡ್ ಹೈಕು200ms120 ಟಾಕ್/ಸೆ1.87ಸೆ4.37ಸೆ
ಜೆಮಿನಿ 1.5 ಫ್ಲ್ಯಾಶ್200ms140 ಟಾಕ್/ಸೆ1.63 ಸೆ3.77ಸೆ
o1 (ತಾರ್ಕಿಕ)3,000ms50 ಟೋಕ್/ಸೆ7.00 ಸೆ13.00 ಸೆ
ಲಾಮಾ 3 70B (H100)100ms90 ಟೋಕ್/ಸೆ2.32ಸೆ5.66 ಸೆ

Frequently Asked Questions

▾
Q

ಯಾವ LLM ಕಡಿಮೆ ಸುಪ್ತತೆಯನ್ನು ಹೊಂದಿದೆ?

A

ಪ್ರಮುಖ ವಾಣಿಜ್ಯ ಮಾದರಿಗಳಲ್ಲಿ, GPT-4o-mini 100 ರಿಂದ 200ms TTFT ಮತ್ತು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 120 ರಿಂದ 150 ಟೋಕನ್‌ಗಳೊಂದಿಗೆ ಕಡಿಮೆ ಸುಪ್ತತೆಯನ್ನು ಸ್ಥಿರವಾಗಿ ನೀಡುತ್ತದೆ. ಕ್ಲೌಡ್ ಹೈಕು ಇದೇ ವೇಗವಾಗಿದೆ. ಪ್ರಮುಖ ಮಾದರಿಗಳಲ್ಲಿ, GPT-4o ಕ್ಲೌಡ್ ಸಾನೆಟ್ 4 ಗಿಂತ ಸ್ವಲ್ಪ ವೇಗವಾಗಿರುತ್ತದೆ. o1 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳು 2 ರಿಂದ 10 ಸೆಕೆಂಡುಗಳ TTFT ಯೊಂದಿಗೆ ಆಂತರಿಕ ಚಿಂತನೆಯ ಕಾರಣದಿಂದಾಗಿ ಗಮನಾರ್ಹವಾಗಿ ನಿಧಾನವಾಗಿರುತ್ತವೆ. H100 GPU ಗಳಲ್ಲಿ ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಲಾದ ಮಾದರಿಗಳು ಉಪ-100ms TTFT ಅನ್ನು ಸಾಧಿಸಬಹುದು ಆದರೆ ಗಮನಾರ್ಹ ಮೂಲಸೌಕರ್ಯ ಹೂಡಿಕೆಯ ಅಗತ್ಯವಿರುತ್ತದೆ.

Q

ಪ್ರಾಂಪ್ಟ್ ಉದ್ದವು ಸುಪ್ತತೆಯ ಮೇಲೆ ಹೇಗೆ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ?

A

ದೀರ್ಘವಾದ ಇನ್‌ಪುಟ್ ಪ್ರಾಂಪ್ಟ್‌ಗಳು TTFT ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ ಏಕೆಂದರೆ ಮೊದಲ ಔಟ್‌ಪುಟ್ ಟೋಕನ್ ಅನ್ನು ಉತ್ಪಾದಿಸುವ ಮೊದಲು ಮಾದರಿಯು ಎಲ್ಲಾ ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಬೇಕು. ಕನಿಷ್ಠ ಪ್ರಾಂಪ್ಟ್‌ಗೆ ಹೋಲಿಸಿದರೆ 1,000 ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದು ಸಾಮಾನ್ಯವಾಗಿ 100 ರಿಂದ 300ms ಅನ್ನು ಸೇರಿಸುತ್ತದೆ. 10,000 ಇನ್‌ಪುಟ್ ಟೋಕನ್‌ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದರಿಂದ 500 ರಿಂದ 1,500ms ಅನ್ನು ಸೇರಿಸಬಹುದು. ಇದಕ್ಕಾಗಿಯೇ ದೊಡ್ಡ ಹಿಂಪಡೆಯಲಾದ ಸಂದರ್ಭವನ್ನು ಹೊಂದಿರುವ RAG ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ಸರಳ ಚಾಟ್‌ಬಾಟ್ ಸಂವಹನಗಳಿಗಿಂತ ಹೆಚ್ಚಿನ ಸುಪ್ತತೆಯನ್ನು ಹೊಂದಿವೆ. ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ (ಆಂಥ್ರೊಪಿಕ್‌ನಿಂದ ಲಭ್ಯವಿದೆ) ಪುನರಾವರ್ತಿತ ಪ್ರಾಂಪ್ಟ್ ಪೂರ್ವಪ್ರತ್ಯಯಗಳಿಗಾಗಿ ಈ ಪ್ರಕ್ರಿಯೆಯ ಸಮಯವನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ.

Q

ನಾನು ಎಲ್ಲಾ API ಕರೆಗಳಿಗೆ ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಬಳಸಬೇಕೇ?

A

ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಉತ್ಪಾದಿಸಲು 1 ಸೆಕೆಂಡ್‌ಗಿಂತ ಹೆಚ್ಚು ತೆಗೆದುಕೊಳ್ಳುವ ಯಾವುದೇ ಬಳಕೆದಾರ-ಮುಖದ ಪ್ರತಿಕ್ರಿಯೆಗಾಗಿ ಬಳಸಬೇಕು. ಪ್ರೋಗ್ರಾಮ್ಯಾಟಿಕ್ API ಕರೆಗಳಿಗೆ ಔಟ್‌ಪುಟ್ ಅನ್ನು ಬಳಕೆದಾರರಿಗೆ ಪ್ರದರ್ಶಿಸುವ ಬದಲು ಕೋಡ್ ಮೂಲಕ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲಾಗುತ್ತದೆ, ಸ್ಟ್ರೀಮಿಂಗ್ ಅಲ್ಲದಿರುವುದು ಸರಳವಾಗಿದೆ ಮತ್ತು ಅತ್ಯಲ್ಪ ಲೇಟೆನ್ಸಿ ಪ್ರಯೋಜನವನ್ನು ಹೊಂದಿದೆ. ಸ್ಟ್ರೀಮಿಂಗ್ ಹೆಚ್ಚಿನ SDK ಗಳೊಂದಿಗೆ ಕನಿಷ್ಠ ಕೋಡ್ ಸಂಕೀರ್ಣತೆಯನ್ನು ಸೇರಿಸುತ್ತದೆ ಮತ್ತು ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವಿಲ್ಲದೆ ಎಲ್ಲಾ ಪ್ರಮುಖ ಪೂರೈಕೆದಾರರಿಂದ ಬೆಂಬಲಿತವಾಗಿದೆ. ಸ್ಟ್ರೀಮಿಂಗ್‌ನಿಂದ ಗ್ರಹಿಸಿದ ಲೇಟೆನ್ಸಿ ಸುಧಾರಣೆಯು ಗಣನೀಯವಾಗಿದೆ: ಸ್ಟ್ರೀಮ್ ಮಾಡಿದಾಗ 10-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಯು 1 ಸೆಕೆಂಡ್‌ನಂತೆ ಭಾಸವಾಗುತ್ತದೆ.

Q

ನನ್ನ ಅಪ್ಲಿಕೇಶನ್‌ಗಾಗಿ ನಾನು TTFT ಅನ್ನು ಹೇಗೆ ಕಡಿಮೆ ಮಾಡುವುದು?

A

ಪ್ರಮುಖ TTFT ಆಪ್ಟಿಮೈಸೇಶನ್‌ಗಳು ಸೇರಿವೆ: ಪುನರಾವರ್ತಿತ ಪ್ರಾಂಪ್ಟ್ ಪೂರ್ವಪ್ರತ್ಯಯಗಳ ಸಂಸ್ಕರಣೆಯನ್ನು ಬಿಟ್ಟುಬಿಡಲು ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಅನ್ನು ಬಳಸುವುದು (200 ರಿಂದ 500ms ಉಳಿಸುತ್ತದೆ), ಭೌಗೋಳಿಕವಾಗಿ ಹತ್ತಿರವಿರುವ API ಅಂತಿಮ ಬಿಂದುಗಳನ್ನು ಆರಿಸುವುದು (ನೆಟ್‌ವರ್ಕ್ ರೌಂಡ್-ಟ್ರಿಪ್‌ನ 50 ರಿಂದ 200ms ಉಳಿಸುತ್ತದೆ), ಇನ್‌ಪುಟ್ ಪ್ರಾಂಪ್ಟ್ ಉದ್ದವನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು ಮತ್ತು ಮಾದರಿಗಳನ್ನು 500 ನಂತೆ ಉಳಿಸುತ್ತದೆ. GPT-4o-mini (GPT-4o ವಿರುದ್ಧ 100 ರಿಂದ 300ms ಉಳಿಸುತ್ತದೆ). ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಲಾದ ಮಾದರಿಗಳಿಗಾಗಿ, vLLM ನಂತಹ ಆಪ್ಟಿಮೈಸ್ಡ್ ಸರ್ವಿಂಗ್ ಫ್ರೇಮ್‌ವರ್ಕ್‌ಗಳೊಂದಿಗೆ GPU-ವೇಗವರ್ಧಿತ ನಿರ್ಣಯವು ಉಪ-100ms TTFT ಅನ್ನು ಸಾಧಿಸಬಹುದು.

Q

ವಿವಿಧ ಅಪ್ಲಿಕೇಶನ್ ಪ್ರಕಾರಗಳಿಗೆ ಸ್ವೀಕಾರಾರ್ಹ ಲೇಟೆನ್ಸಿ ಯಾವುದು?

A

ಹುಡುಕಾಟ ಮತ್ತು ಸ್ವಯಂಪೂರ್ಣತೆ: 500ms ಅಡಿಯಲ್ಲಿ. ಚಾಟ್‌ಬಾಟ್ ಪ್ರತಿಕ್ರಿಯೆಗಳು: 3 ಸೆಕೆಂಡುಗಳಲ್ಲಿ (ಸ್ಟ್ರೀಮಿಂಗ್‌ನೊಂದಿಗೆ). ವಿಷಯ ಉತ್ಪಾದನೆ: 10 ಸೆಕೆಂಡುಗಳಿಗಿಂತ ಕಡಿಮೆ (ಸ್ಟ್ರೀಮಿಂಗ್ ಪ್ರಗತಿ ಸೂಚಕದೊಂದಿಗೆ). ಬ್ಯಾಚ್ ಪ್ರಕ್ರಿಯೆ: ನಿಮಿಷಗಳಿಂದ ಗಂಟೆಗಳವರೆಗೆ (ಯಾವುದೇ ಲೇಟೆನ್ಸಿ ಅಗತ್ಯವಿಲ್ಲ). ಧ್ವನಿ ಸಹಾಯಕರು: 2 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಒಟ್ಟು ಪೈಪ್‌ಲೈನ್. ಕೋಡ್ ಪೂರ್ಣಗೊಳಿಸುವಿಕೆ: ಇನ್‌ಲೈನ್ ಸಲಹೆಗಳಿಗಾಗಿ 500ms ಅಡಿಯಲ್ಲಿ. ಈ ಮಿತಿಗಳು ಬಳಕೆದಾರರ ಅನುಭವ ಸಂಶೋಧನೆ ಮತ್ತು ಸ್ಪರ್ಧಾತ್ಮಕ ಮಾನದಂಡಗಳನ್ನು ಆಧರಿಸಿವೆ.

Common Mistakes to Avoid

▾
  • !ಲೇಟೆನ್ಸಿ ಇಂಪ್ಯಾಕ್ಟ್ ಅನ್ನು ನಿರ್ಲಕ್ಷಿಸುವಾಗ ಟೋಕನ್ ವೆಚ್ಚಕ್ಕೆ ಮಾತ್ರ ಆಪ್ಟಿಮೈಜ್ ಮಾಡುವುದು:
  • !ದೀರ್ಘ ಪ್ರತಿಕ್ರಿಯೆಗಳಿಗಾಗಿ ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಬಳಸದಿರುವುದು:
  • !TTFT ವ್ಯತ್ಯಾಸ ಮತ್ತು P99 ಸುಪ್ತತೆಯನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತಿದೆ:
💡

Pro Tip

ನಿಮ್ಮ ಸಂಪೂರ್ಣ ವಿನಂತಿಯ ಪೈಪ್‌ಲೈನ್‌ಗಾಗಿ ಲೇಟೆನ್ಸಿ ಬಜೆಟ್ ಅನ್ನು ಅಳವಡಿಸಿ ಮತ್ತು ಅದನ್ನು ಘಟಕಗಳಾದ್ಯಂತ ನಿಯೋಜಿಸಿ. 3-ಸೆಕೆಂಡ್ ಚಾಟ್‌ಬಾಟ್ ಬಜೆಟ್‌ಗಾಗಿ: ನೆಟ್‌ವರ್ಕ್ ಮತ್ತು ಪ್ರಿಪ್ರೊಸೆಸಿಂಗ್‌ಗಾಗಿ 200ms, RAG ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ 200ms, TTFT ಗಾಗಿ 300ms ಮತ್ತು ಟೋಕನ್ ಉತ್ಪಾದನೆಗೆ 2,300ms (GPT-4o-mini ನಲ್ಲಿ 130 tok/s ನಲ್ಲಿ ಸುಮಾರು 300 ಟೋಕನ್‌ಗಳನ್ನು ಅನುಮತಿಸುತ್ತದೆ). ಈ ಬಜೆಟ್ ವಿಧಾನವು ಪ್ರತ್ಯೇಕ ಘಟಕಗಳನ್ನು ಅವುಗಳ ಪಾಲುಗಿಂತ ಹೆಚ್ಚಿನದನ್ನು ಸೇವಿಸುವುದನ್ನು ತಡೆಯುತ್ತದೆ ಮತ್ತು ಒಂದು ಘಟಕಕ್ಕೆ ಆಪ್ಟಿಮೈಸೇಶನ್ ಅಗತ್ಯವಿರುವಾಗ ಅಥವಾ ವೇಗವಾದ ಮಾದರಿಯ ಅಗತ್ಯವಿರುವಾಗ ಹೈಲೈಟ್ ಮಾಡುತ್ತದೆ.

⭐

Did you know?

ಮಾನವ ಸಂಭಾಷಣೆಯ ತಿರುವು-ತೆಗೆದುಕೊಳ್ಳುವಿಕೆಯು ಒಬ್ಬ ವ್ಯಕ್ತಿಯು ಮುಗಿಸುವ ಮತ್ತು ಇನ್ನೊಬ್ಬರು ಮಾತನಾಡಲು ಪ್ರಾರಂಭಿಸುವ ನಡುವೆ ಸುಮಾರು 200 ಮಿಲಿಸೆಕೆಂಡುಗಳ ನೈಸರ್ಗಿಕ ಅಂತರವನ್ನು ಹೊಂದಿರುತ್ತದೆ. AI ಚಾಟ್‌ಬಾಟ್ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವು 3 ಸೆಕೆಂಡುಗಳನ್ನು ಮೀರಿದಾಗ, ಬಳಕೆದಾರರು ಅರಿವಿಲ್ಲದೆ 'ಸಂಭಾಷಣೆ' ಮಾನಸಿಕ ಮಾದರಿಯ ಬದಲಿಗೆ 'ವೆಬ್ ಹುಡುಕಾಟ' ಮಾನಸಿಕ ಮಾದರಿಯನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುತ್ತಾರೆ, ಕಡಿಮೆ ತೊಡಗಿಸಿಕೊಳ್ಳುತ್ತಾರೆ ಮತ್ತು ತ್ಯಜಿಸುವ ಸಾಧ್ಯತೆ ಹೆಚ್ಚು. ಉಪ-2-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಸಾಧಿಸುವುದು ಬಳಕೆದಾರರನ್ನು ಸಂಭಾಷಣೆಯ ಮನಸ್ಥಿತಿಯಲ್ಲಿ ಇರಿಸುತ್ತದೆ, ತೊಡಗಿಸಿಕೊಳ್ಳುವಿಕೆ ಮತ್ತು ತೃಪ್ತಿಯ ಸ್ಕೋರ್‌ಗಳನ್ನು 25 ರಿಂದ 40 ಪ್ರತಿಶತದಷ್ಟು ಹೆಚ್ಚಿಸುತ್ತದೆ.

Regional Guides

▾
North America▾
ಪಶ್ಚಿಮ ಮತ್ತು ಪೂರ್ವ US ನಲ್ಲಿ OpenAI ಮತ್ತು Anthropic API ಎಂಡ್ ಪಾಯಿಂಟ್‌ಗಳಿಗೆ ಸಂಪರ್ಕಿಸುವ US-ಆಧಾರಿತ ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ಕಡಿಮೆ ಸುಪ್ತತೆಯನ್ನು ಅನುಭವಿಸುತ್ತವೆ, ಸಾಮಾನ್ಯವಾಗಿ 20 ರಿಂದ 50ms ನೆಟ್‌ವರ್ಕ್ ರೌಂಡ್-ಟ್ರಿಪ್ ಸಮಯ. ಈ ಭೌಗೋಳಿಕ ಪ್ರಯೋಜನವೆಂದರೆ ಉತ್ತರ ಅಮೆರಿಕಾದ ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ನೆಟ್‌ವರ್ಕ್ ಓವರ್‌ಹೆಡ್‌ಗೆ ಸಮಯವನ್ನು ಕಳೆದುಕೊಳ್ಳುವ ಬದಲು ಮಾದರಿ ಉತ್ಪಾದನೆಗೆ ಸಂಪೂರ್ಣ ಲೇಟೆನ್ಸಿ ಬಜೆಟ್ ಅನ್ನು ಬಳಸಬಹುದು.
Europe▾
US-ಆಧಾರಿತ API ಅಂತ್ಯಬಿಂದುಗಳಿಗೆ ಸಂಪರ್ಕಿಸುವ ಯುರೋಪಿಯನ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳು ಪ್ರತಿ ರೀತಿಯಲ್ಲಿ 80 ರಿಂದ 150ms ಹೆಚ್ಚುವರಿ ನೆಟ್‌ವರ್ಕ್ ಲೇಟೆನ್ಸಿಯನ್ನು ಅನುಭವಿಸುತ್ತವೆ, ಪ್ರತಿ API ಕರೆಗೆ 160 ರಿಂದ 300ms ಸೇರಿಸುತ್ತದೆ. EU-ಪ್ರದೇಶದ ಅಂತ್ಯಬಿಂದುಗಳೊಂದಿಗೆ Azure OpenAI ಅಥವಾ Amazon Bedrock ಅನ್ನು ಬಳಸುವುದರಿಂದ ಇದನ್ನು 20 ರಿಂದ 50ms ಗೆ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. ಯುರೋಪಿಯನ್ ಬಳಕೆದಾರರಿಗೆ ಸೇವೆ ಸಲ್ಲಿಸುವ ಲೇಟೆನ್ಸಿ-ಸೆನ್ಸಿಟಿವ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗಾಗಿ, ಮಾದರಿಯ ಆಯ್ಕೆಯು ಸ್ವಲ್ಪ ಹೆಚ್ಚು ಸೀಮಿತವಾಗಿದ್ದರೂ ಸಹ, EU-ಪ್ರದೇಶದ ಅಂತಿಮ ಬಿಂದುಗಳನ್ನು ಬಳಸುವುದು ಅತ್ಯಗತ್ಯ.
Asia-Pacific▾
US API ಎಂಡ್‌ಪಾಯಿಂಟ್‌ಗಳಿಗೆ ಸಂಪರ್ಕಿಸುವ APAC ಬಳಕೆದಾರರು ಪ್ರತಿ ರೀತಿಯಲ್ಲಿ 150 ರಿಂದ 300ms ನೆಟ್‌ವರ್ಕ್ ಲೇಟೆನ್ಸಿಯನ್ನು ಎದುರಿಸುತ್ತಾರೆ, ಪ್ರತಿ ವಿನಂತಿಗೆ 300 ರಿಂದ 600ms ಸೇರಿಸುತ್ತಾರೆ. ಬಹು ಅನುಕ್ರಮ API ಕರೆಗಳನ್ನು ಮಾಡುವ ಏಜೆಂಟ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗೆ ಈ ಓವರ್‌ಹೆಡ್ ವಿಶೇಷವಾಗಿ ಪ್ರಭಾವ ಬೀರುತ್ತದೆ. ಅಮೆಜಾನ್ ಬೆಡ್‌ರಾಕ್ ಅಥವಾ ಗೂಗಲ್ ಕ್ಲೌಡ್ ಮೂಲಕ ಟೋಕಿಯೊ (ಎಪಿ-ಈಶಾನ್ಯ-1) ಅಥವಾ ಸಿಂಗಾಪುರದಲ್ಲಿ (ಎಪಿ-ಆಗ್ನೇಯ-1) API ಅಂತಿಮ ಬಿಂದುಗಳನ್ನು ಬಳಸುವುದರಿಂದ APAC ಬಳಕೆದಾರರಿಗೆ 20 ರಿಂದ 80ms ಗೆ ಲೇಟೆನ್ಸಿ ಕಡಿಮೆಯಾಗುತ್ತದೆ.
📖Difficulty:Advanced
Accuracy-checked
Reviewed October 2026
Our methodology

ಸಾಪ್ತಾಹಿಕ ಗಣಿತ ಸಲಹೆಗಳನ್ನು ಪಡೆಯಿರಿ

ಪ್ರತಿ ವಾರ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಸಲಹೆಗಳನ್ನು ಪಡೆಯುವ 12,000+ ಚಂದಾದಾರರನ್ನು ಸೇರಿ.

🔒
ಉಚಿತ
ಯಾವಾಗಲೂ ಉಚಿತ, ಯಾವುದೇ ನೋಂದಣಿ ಇಲ್ಲ
✓
ನಿಖರ
ಪರಿಶೀಲಿಸಿದ ಸೂತ್ರಗಳು ಮತ್ತು ಲೆಕ್ಕಾಚಾರಗಳು
⚡
ತ್ವರಿತ
ತಕ್ಷಣ ಫಲಿತಾಂಶಗಳು, ಯಾವುದೇ ವಿಳಂಬ ಇಲ್ಲ
📱
ಮೊಬೈಲ್
ಎಲ್ಲಾ ಸಾಧನಗಳಲ್ಲಿ ಕಾರ್ಯ ನಿರ್ವಹಿಸುತ್ತದೆ

ಸೆಟ್ಟಿಂಗ್‌ಗಳು