What is LLM Latency Cost Calculator?
▾
LLM ಲೇಟೆನ್ಸಿ ಕಾಸ್ಟ್ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಡೆವಲಪರ್ಗಳಿಗೆ ಸಮಯದಿಂದ ಮೊದಲ ಟೋಕನ್ (TTFT), ಟೋಕನ್ಗಳು-ಪ್ರತಿ-ಸೆಕೆಂಡ್ ಥ್ರೋಪುಟ್ ಮತ್ತು ವಿವಿಧ ಮಾದರಿಗಳು ಮತ್ತು ಕಾನ್ಫಿಗರೇಶನ್ಗಳಾದ್ಯಂತ ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವನ್ನು ಮಾಡೆಲಿಂಗ್ ಮಾಡುವ ಮೂಲಕ AI ಅಪ್ಲಿಕೇಶನ್ಗಳಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯದ ಗುಪ್ತ ವೆಚ್ಚವನ್ನು ಪ್ರಮಾಣೀಕರಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಹೆಚ್ಚಿನ ವೆಚ್ಚದ ಚರ್ಚೆಗಳು ಟೋಕನ್ ಬೆಲೆಯ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸಿದಾಗ, ಸುಪ್ತತೆಯು ತನ್ನದೇ ಆದ ಆರ್ಥಿಕ ಪರಿಣಾಮವನ್ನು ಹೊಂದಿದೆ: ನಿಧಾನವಾದ ಪ್ರತಿಕ್ರಿಯೆಗಳು ಬಳಕೆದಾರರ ತ್ಯಜಿಸುವಿಕೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ, ಥ್ರೋಪುಟ್ ಸಾಮರ್ಥ್ಯವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು AI-ಚಾಲಿತ ವೈಶಿಷ್ಟ್ಯಗಳ ಗ್ರಹಿಸಿದ ಗುಣಮಟ್ಟವನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ. ಮಾದರಿಗಳು ಮತ್ತು ಪೂರೈಕೆದಾರರಾದ್ಯಂತ ಸುಪ್ತತೆಯು ನಾಟಕೀಯವಾಗಿ ಬದಲಾಗುತ್ತದೆ. GPT-4o ಸಾಮಾನ್ಯವಾಗಿ 200 ರಿಂದ 500 ಮಿಲಿಸೆಕೆಂಡ್ಗಳಲ್ಲಿ ಸಮಯದಿಂದ ಮೊದಲ ಟೋಕನ್ ಅನ್ನು ನೀಡುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 80 ರಿಂದ 120 ಟೋಕನ್ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. GPT-4o-mini 100 ರಿಂದ 300ms TTFT ಮತ್ತು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 100 ರಿಂದ 150 ಟೋಕನ್ಗಳಲ್ಲಿ ವೇಗವಾಗಿರುತ್ತದೆ. ಕ್ಲೌಡ್ ಸಾನೆಟ್ 4 ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 70 ರಿಂದ 100 ಟೋಕನ್ಗಳೊಂದಿಗೆ 300 ರಿಂದ 700ms TTFT ವರೆಗೆ ಇರುತ್ತದೆ. ಈ ವ್ಯತ್ಯಾಸಗಳ ಪ್ರಕಾರ 500-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆಯು ಮಾದರಿ ಆಯ್ಕೆಯನ್ನು ಅವಲಂಬಿಸಿ 3 ರಿಂದ 7 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ, ಬಳಕೆದಾರರ ಅನುಭವ ಮತ್ತು ಅಪ್ಲಿಕೇಶನ್ ವಿನ್ಯಾಸವನ್ನು ನೇರವಾಗಿ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. ಈ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ನೇರ API ವೆಚ್ಚಗಳು, ಸಂಪರ್ಕಗಳನ್ನು ತೆರೆದಿರುವ ಮೂಲಸೌಕರ್ಯ ವೆಚ್ಚಗಳು, ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯದೊಂದಿಗೆ ಪರಸ್ಪರ ಸಂಬಂಧ ಹೊಂದಿರುವ ಬಳಕೆದಾರರ ಡ್ರಾಪ್-ಆಫ್ ದರಗಳು ಮತ್ತು ಅದೇ ವಿನಂತಿಯ ಪರಿಮಾಣವನ್ನು ಪೂರೈಸಲು ಹೆಚ್ಚು ಏಕಕಾಲಿಕ ಸಂಪರ್ಕಗಳ ಅಗತ್ಯವಿರುವ ನಿಧಾನಗತಿಯ ಮಾದರಿಗಳ ಥ್ರೋಪುಟ್ ಪರಿಣಾಮಗಳನ್ನು ಒಳಗೊಂಡಂತೆ ಸುಪ್ತತೆಯ ಒಟ್ಟು ವೆಚ್ಚವನ್ನು ರೂಪಿಸುತ್ತದೆ. ಚಾಟ್ಬಾಟ್ಗಳು ಮತ್ತು ಹುಡುಕಾಟದಂತಹ ನೈಜ-ಸಮಯದ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗಾಗಿ, ಲೇಟೆನ್ಸಿ ಆಪ್ಟಿಮೈಸೇಶನ್ ಒಟ್ಟಾರೆ ಸಿಸ್ಟಂ ಅರ್ಥಶಾಸ್ತ್ರಕ್ಕೆ ಟೋಕನ್ ವೆಚ್ಚ ಆಪ್ಟಿಮೈಸೇಶನ್ನಂತೆಯೇ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
ಸೂತ್ರ
▾
ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ = ಮೊದಲ ಟೋಕನ್ಗೆ ಸಮಯ + (ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳು / ಟೋಕನ್ಗಳು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ). ಪ್ರತಿ ವಿನಂತಿಗೆ ಪರಿಣಾಮಕಾರಿ ವೆಚ್ಚ = API ಟೋಕನ್ ವೆಚ್ಚ + (ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ / 3600) x ಪ್ರತಿ ಗಂಟೆಗೆ ಸರ್ವರ್ ಸಂಪರ್ಕದ ವೆಚ್ಚ + ಡ್ರಾಪ್-ಆಫ್ ಸಂಭವನೀಯತೆ x ಪ್ರತಿ ಬಳಕೆದಾರರಿಗೆ ಕಳೆದುಹೋದ ಆದಾಯ. ಉದಾಹರಣೆಗೆ: 100 tok/s ನಲ್ಲಿ 400ms TTFT + 300 ಟೋಕನ್ಗಳು = 400ms + 3,000ms = 3.4 ಸೆಕೆಂಡುಗಳ ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯ.Variable Legend
▾
| ಚಿಹ್ನೆ | ಹೆಸರು | ಘಟಕ | ವಿವರಣೆ |
|---|---|---|---|
| TTFT | ಮೊದಲ ಟೋಕನ್ಗೆ ಸಮಯ | milliseconds | API ವಿನಂತಿಯನ್ನು ಕಳುಹಿಸುವ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆಯ ಮೊದಲ ಟೋಕನ್ ಅನ್ನು ಸ್ವೀಕರಿಸುವ ನಡುವಿನ ವಿಳಂಬ, ಇದು ಕನಿಷ್ಠ ಗ್ರಹಿಸಿದ ಸುಪ್ತತೆಯನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ. |
| TPS | ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಟೋಕನ್ಗಳು | tokens per second | ಮೊದಲ ಟೋಕನ್ ನಂತರ ಪೀಳಿಗೆಯ ವೇಗ, ಪೂರ್ಣ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಎಷ್ಟು ಬೇಗನೆ ಉತ್ಪಾದಿಸಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ, ಸಾಮಾನ್ಯವಾಗಿ ಪ್ರಮಾಣಿತ ಮಾದರಿಗಳಿಗೆ 80 ರಿಂದ 150. |
| T_out | ಔಟ್ಪುಟ್ ಟೋಕನ್ ಎಣಿಕೆ | tokens | ಮಾದರಿ ಪ್ರತಿಕ್ರಿಯೆಯಲ್ಲಿನ ಟೋಕನ್ಗಳ ಸಂಖ್ಯೆ, ಪೀಳಿಗೆಯ ವೇಗದಿಂದ ಗುಣಿಸಿದಾಗ TTFT ನಂತರ ಸ್ಟ್ರೀಮಿಂಗ್ ಅವಧಿಯನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. |
| D | ಡ್ರಾಪ್-ಆಫ್ ದರ | ratio per second of latency | ಪ್ರತಿ ಸೆಕೆಂಡ್ಗೆ ಪ್ರತಿ ಸೆಕೆಂಡ್ಗೆ ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 5 ರಿಂದ 15 ಪ್ರತಿಶತದಷ್ಟು 3-ಸೆಕೆಂಡ್ ಥ್ರೆಶೋಲ್ಡ್ಗಿಂತ ಹೆಚ್ಚಿನ ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಪರಸ್ಪರ ಕ್ರಿಯೆಯನ್ನು ತ್ಯಜಿಸುವ ಬಳಕೆದಾರರ ಅಂದಾಜು ಭಾಗ. |
| V_user | ಕಳೆದುಹೋದ ಬಳಕೆದಾರರಿಗೆ ಮೌಲ್ಯ | USD | ಮಿತಿಮೀರಿದ ಸುಪ್ತತೆಯಿಂದಾಗಿ AI ಪರಸ್ಪರ ಕ್ರಿಯೆಯನ್ನು ಬಳಕೆದಾರರು ತ್ಯಜಿಸಿದಾಗ ಅಂದಾಜು ಆದಾಯ ಅಥವಾ ಗ್ರಾಹಕ ಮೌಲ್ಯವು ಕಳೆದುಹೋಗುತ್ತದೆ. |
How to LLM Latency Cost Calculator
▾
- 1ನೀವು ಆಯ್ಕೆ ಮಾಡಿದ ಮಾದರಿ ಮತ್ತು ಕಾನ್ಫಿಗರೇಶನ್ಗಾಗಿ ಸಮಯದಿಂದ ಮೊದಲ ಟೋಕನ್ (TTFT) ಅನ್ನು ಅಳೆಯಿರಿ ಅಥವಾ ಅಂದಾಜು ಮಾಡಿ. TTFT ಎಂಬುದು API ವಿನಂತಿಯನ್ನು ಕಳುಹಿಸುವ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆಯ ಮೊದಲ ಟೋಕನ್ ಅನ್ನು ಸ್ವೀಕರಿಸುವ ನಡುವಿನ ವಿಳಂಬವಾಗಿದೆ. ಇದು ಮಾದರಿಯ ಸಂಕೀರ್ಣತೆ, ಇನ್ಪುಟ್ ಪ್ರಾಂಪ್ಟ್ ಉದ್ದ, ಸರ್ವರ್ ಲೋಡ್ ಮತ್ತು API ಎಂಡ್ಪಾಯಿಂಟ್ಗೆ ಭೌಗೋಳಿಕ ಅಂತರವನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ. GPT-4o TTFT 200 ರಿಂದ 500ms ವರೆಗೆ ಇರುತ್ತದೆ, ಆದರೆ o1 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳು ಆರಂಭಿಕ ಚಿಂತನೆಯ ಹಂತಕ್ಕೆ 2 ರಿಂದ 10 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಬಹುದು.
- 2ನಿಮ್ಮ ಮಾದರಿಗಾಗಿ ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಟೋಕನ್ಗಳ ಪೀಳಿಗೆಯ ದರವನ್ನು ನಿರ್ಧರಿಸಿ. ಮೊದಲ ಟೋಕನ್ ಬಂದ ನಂತರ ಮಾದರಿಯು ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ವೇಗ ಇದು. ಪ್ರಮಾಣಿತ ಮಾದರಿಗಳು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 80 ರಿಂದ 150 ಟೋಕನ್ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತವೆ. ದೀರ್ಘವಾದ ಔಟ್ಪುಟ್ಗಳು ಪ್ರಮಾಣಾನುಗುಣವಾಗಿ ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುತ್ತವೆ: ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 100 ಟೋಕನ್ಗಳಲ್ಲಿ 500-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆಯು TTFT ನಂತರ 5 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. ಬಳಕೆದಾರರಿಗೆ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಸ್ಟ್ರೀಮ್ ಮಾಡುವುದರಿಂದ ಅವರು ಬಂದಂತೆ ಟೋಕನ್ಗಳನ್ನು ತೋರಿಸುವ ಮೂಲಕ ಗ್ರಹಿಸಿದ ಸುಪ್ತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
- 3ನಿಮ್ಮ ವಿಶಿಷ್ಟ ಔಟ್ಪುಟ್ ಉದ್ದಗಳಿಗಾಗಿ ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವನ್ನು ಲೆಕ್ಕಹಾಕಿ. GPT-4o ನಲ್ಲಿ 200-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಹೊಂದಿರುವ ಚಾಟ್ಬಾಟ್ಗಾಗಿ: TTFT (350ms) + ಜನರೇಷನ್ (200 ಟೋಕನ್ಗಳು / 100 tok/s = 2,000ms) = 2.35 ಸೆಕೆಂಡುಗಳು. 1,000-ಟೋಕನ್ ಔಟ್ಪುಟ್ಗಳೊಂದಿಗೆ ವಿಷಯ ರಚನೆ ವೈಶಿಷ್ಟ್ಯಕ್ಕಾಗಿ: TTFT (350ms) + ಜನರೇಷನ್ (10,000ms) = 10.35 ಸೆಕೆಂಡುಗಳು. ವೈಶಿಷ್ಟ್ಯವು ಬಳಕೆದಾರರಿಗೆ ಸ್ಪಂದಿಸುತ್ತದೆಯೇ ಅಥವಾ ನಿಧಾನವಾಗಿರುತ್ತದೆಯೇ ಎಂಬುದನ್ನು ಈ ಸಮಯಗಳು ನಿರ್ಧರಿಸುತ್ತವೆ.
- 4ಲೇಟೆನ್ಸಿಯ ಬಳಕೆದಾರರ ಅನುಭವದ ಪ್ರಭಾವವನ್ನು ಮಾದರಿ ಮಾಡಿ. ಬಳಕೆದಾರರ ತೃಪ್ತಿಯು 3-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯಕ್ಕಿಂತ ಗಮನಾರ್ಹವಾಗಿ ಇಳಿಯುತ್ತದೆ ಎಂದು ಸಂಶೋಧನೆ ತೋರಿಸುತ್ತದೆ. ಚಾಟ್ಬಾಟ್ಗಳಿಗೆ, 5 ಸೆಕೆಂಡ್ಗಳ ಮೇಲಿನ ಪ್ರತಿಕ್ರಿಯೆಗಳು 20 ರಿಂದ 30 ಪ್ರತಿಶತದಷ್ಟು ಬಳಕೆದಾರರು ಸಂಭಾಷಣೆಯನ್ನು ತ್ಯಜಿಸಲು ಕಾರಣವಾಗುತ್ತವೆ. ಹುಡುಕಾಟ ವೈಶಿಷ್ಟ್ಯಗಳಿಗಾಗಿ, 2 ಸೆಕೆಂಡುಗಳಿಗಿಂತ ಹೆಚ್ಚು ಸಮಯ ತೆಗೆದುಕೊಳ್ಳುವ ಫಲಿತಾಂಶಗಳು 10 ರಿಂದ 15 ಪ್ರತಿಶತ ಕಡಿಮೆ ನಿಶ್ಚಿತಾರ್ಥವನ್ನು ನೋಡಿ. ಕ್ಯಾಲ್ಕುಲೇಟರ್ ನಿಮ್ಮ ಪರಿವರ್ತನೆ ದರಗಳು ಮತ್ತು ಬಳಕೆದಾರರ ಜೀವಿತಾವಧಿಯ ಮೌಲ್ಯವನ್ನು ಆಧರಿಸಿ ಕಳೆದುಹೋದ ನಿಶ್ಚಿತಾರ್ಥಕ್ಕೆ ಡಾಲರ್ ಮೌಲ್ಯವನ್ನು ನಿಯೋಜಿಸುತ್ತದೆ.
- 5ಥ್ರೋಪುಟ್ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಅದರ ವೆಚ್ಚದ ಪರಿಣಾಮಗಳನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ. ಸ್ಟ್ರೀಮಿಂಗ್ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ನಿರ್ವಹಿಸುವ ಸರ್ವರ್ ಪೂರ್ಣ ಪ್ರತಿಕ್ರಿಯೆ ಅವಧಿಯವರೆಗೆ ಸಂಪರ್ಕಗಳನ್ನು ತೆರೆದಿರಬೇಕು. ಪ್ರತಿ ಪ್ರತಿಕ್ರಿಯೆಯು 5 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಂಡರೆ, ಒಂದು ಸರ್ವರ್ ಥ್ರೆಡ್ ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ 12 ವಿನಂತಿಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತದೆ. 2 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಪ್ರತಿಕ್ರಿಯಿಸುವ ವೇಗದ ಮಾದರಿಗೆ ಬದಲಾಯಿಸುವುದರಿಂದ ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ 30 ವಿನಂತಿಗಳಿಗೆ ಥ್ರೋಪುಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ, ಅದೇ ಟ್ರಾಫಿಕ್ಗೆ 60 ಪ್ರತಿಶತ ಕಡಿಮೆ ಸರ್ವರ್ ಸಂಪನ್ಮೂಲಗಳು ಬೇಕಾಗುತ್ತವೆ. ಈ ಮೂಲಸೌಕರ್ಯ ಉಳಿತಾಯವು ಮಾದರಿಗಳ ನಡುವಿನ API ವೆಚ್ಚದ ವ್ಯತ್ಯಾಸವನ್ನು ಮೀರಬಹುದು.
- 6ಟೋಕನ್ ಬೆಲೆ ಮತ್ತು ಲೇಟೆನ್ಸಿ ವೆಚ್ಚಗಳನ್ನು ಒಳಗೊಂಡಂತೆ ಮಾದರಿ ಆಯ್ಕೆಗಳಾದ್ಯಂತ ಒಟ್ಟು ವೆಚ್ಚವನ್ನು ಹೋಲಿಕೆ ಮಾಡಿ. ಮೂಲಸೌಕರ್ಯ, ಬಳಕೆದಾರರ ಡ್ರಾಪ್-ಆಫ್ ಮತ್ತು ಥ್ರೋಪುಟ್ ನಿರ್ಬಂಧಗಳನ್ನು ಲೆಕ್ಕಹಾಕುವಾಗ ನಿಧಾನವಾದ ಪ್ರತಿ ಟೋಕನ್ ಮಾದರಿಯು ಹೆಚ್ಚು ವೆಚ್ಚವಾಗಬಹುದು. ಕ್ಯಾಲ್ಕುಲೇಟರ್ API ವೆಚ್ಚ, ಸರ್ವರ್ ವೆಚ್ಚ ಮತ್ತು ಸುಪ್ತತೆಯಿಂದ ಅಂದಾಜು ಆದಾಯದ ಪ್ರಭಾವವನ್ನು ಒಳಗೊಂಡಿರುವ ಒಟ್ಟು ಆರ್ಥಿಕ ಹೋಲಿಕೆಯನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ.
- 7ಕಾನ್ಫಿಗರೇಶನ್ ಬದಲಾವಣೆಗಳ ಮೂಲಕ ಸುಪ್ತತೆಯನ್ನು ಆಪ್ಟಿಮೈಜ್ ಮಾಡಿ. max_tokens ನೊಂದಿಗೆ ಔಟ್ಪುಟ್ ಟೋಕನ್ ಮಿತಿಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು, ಗ್ರಹಿಸಿದ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಸುಧಾರಿಸಲು ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಬಳಸುವುದು, TTFT ಅನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಅನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸುವುದು ಮತ್ತು ಭೌಗೋಳಿಕವಾಗಿ ಹತ್ತಿರವಿರುವ API ಅಂತಿಮ ಬಿಂದುಗಳನ್ನು ಆರಿಸುವುದರಿಂದ ಪ್ರತಿಯೊಂದೂ ಮಾದರಿಗಳನ್ನು ಬದಲಾಯಿಸದೆಯೇ 20 ರಿಂದ 50 ಪ್ರತಿಶತದಷ್ಟು ಸುಪ್ತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಪ್ರತಿ ಆಪ್ಟಿಮೈಸೇಶನ್ನ ವೆಚ್ಚದ ಪ್ರಭಾವವನ್ನು ರೂಪಿಸುತ್ತದೆ.
Worked Examples
▾
3-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಗಳ ಅಡಿಯಲ್ಲಿ ಟಾರ್ಗೆಟ್ ಮಾಡುವ ಚಾಟ್ಬಾಟ್ಗಾಗಿ, GPT-4o ಮತ್ತು GPT-4o-mini ಎರಡೂ ಮಿತಿಯನ್ನು ಪೂರೈಸುತ್ತವೆ ಆದರೆ Claude Sonnet 4 ಗಡಿರೇಖೆಯಾಗಿದೆ. GPT-4o-mini GPT-4o ಗಿಂತ 28 ಪ್ರತಿಶತ ವೇಗವಾಗಿದೆ ಮತ್ತು 94 ಪ್ರತಿಶತ ಅಗ್ಗವಾಗಿದೆ, ಇದು ಹೆಚ್ಚಿನ ಚಾಟ್ಬಾಟ್ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗೆ ಅತ್ಯುತ್ತಮ ಆಯ್ಕೆಯಾಗಿದೆ.
ಪ್ರತಿ 1,000-ಟೋಕನ್ ಪೀಳಿಗೆಯು 10.4 ಸೆಕೆಂಡುಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. 50 ಏಕಕಾಲೀನ ಬಳಕೆದಾರರಿಗೆ ಸೇವೆ ಸಲ್ಲಿಸಲು, ನಿಮಗೆ ಸರಿಸುಮಾರು 9 ಸರ್ವರ್ ಥ್ರೆಡ್ಗಳನ್ನು ಹೊಂದಿರುವ ಸಂಪರ್ಕಗಳನ್ನು ತೆರೆದಿರಬೇಕು. ಸರ್ವರ್ ಮೂಲಸೌಕರ್ಯಕ್ಕೆ ಪ್ರತಿ ಗಂಟೆಗೆ $5, ಥ್ರೋಪುಟ್ ವೆಚ್ಚವು API ಟೋಕನ್ ವೆಚ್ಚದ ಮೇಲೆ ಪ್ರತಿ ವಿನಂತಿಗೆ $0.0024 ಅನ್ನು ಸೇರಿಸುತ್ತದೆ.
ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ 200ms ಮತ್ತು 150ms TTFT ನಂತರ, ಟೋಕನ್ ಉತ್ಪಾದನೆಗೆ 1,450ms ಉಳಿದಿವೆ. ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 130 ಟೋಕನ್ಗಳಲ್ಲಿ, ಗರಿಷ್ಠ ಔಟ್ಪುಟ್ 188 ಟೋಕನ್ಗಳು. ವೈಶಿಷ್ಟ್ಯಕ್ಕೆ ದೀರ್ಘವಾದ ಪ್ರತಿಕ್ರಿಯೆಗಳ ಅಗತ್ಯವಿದ್ದರೆ, ಲೇಟೆನ್ಸಿ ಬಜೆಟ್ ಅನ್ನು ಹೆಚ್ಚಿಸಬೇಕು ಅಥವಾ ವೇಗವಾದ ಮಾದರಿ ಅಥವಾ ಕಡಿಮೆ ಮರುಪಡೆಯುವಿಕೆ ಸಮಯ ಬೇಕಾಗುತ್ತದೆ.
Real-World Applications
▾
AI-ಚಾಲಿತ ಉತ್ತರ ಉತ್ಪಾದನೆಯೊಂದಿಗೆ ಹುಡುಕಾಟ ಎಂಜಿನ್ಗಳು ಸಾಂಪ್ರದಾಯಿಕ ಹುಡುಕಾಟದಿಂದ ಹೊಂದಿಸಲಾದ ಬಳಕೆದಾರರ ನಿರೀಕ್ಷೆಗಳನ್ನು ಹೊಂದಿಸಲು 2 ರಿಂದ 3 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಫಲಿತಾಂಶಗಳನ್ನು ತಲುಪಿಸಬೇಕು. ಉತ್ತರ ಸಂಶ್ಲೇಷಣೆಗಾಗಿ GPT-4o ಅನ್ನು ಬಳಸುವ ಹುಡುಕಾಟ ವೇದಿಕೆಯು ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ 500ms ಮತ್ತು LLM ಉತ್ಪಾದನೆಗೆ 2,000ms ಬಜೆಟ್. ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 100 ಟೋಕನ್ಗಳಲ್ಲಿ, ಅವರು ಸುಪ್ತ ಬಜೆಟ್ನಲ್ಲಿ ಸರಿಸುಮಾರು 170 ಟೋಕನ್ಗಳನ್ನು (ಸುಮಾರು 130 ಪದಗಳು) ರಚಿಸಬಹುದು. ಈ ನಿರ್ಬಂಧವು ಗರಿಷ್ಠ ಉತ್ತರದ ಉದ್ದವನ್ನು ನಿರ್ದೇಶಿಸುತ್ತದೆ ಮತ್ತು ವೇಗವಾಗಿ ಲಭ್ಯವಿರುವ ಮಾದರಿಯ ಆಯ್ಕೆಯನ್ನು ಚಾಲನೆ ಮಾಡುತ್ತದೆ.
ನೈಜ-ಸಮಯದ ಅನುವಾದ ಸೇವೆಗಳು ಸಂವಾದದ ಹರಿವಿಗಾಗಿ ಸುಪ್ತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡಬೇಕು. GPT-4o-mini ಬಳಸುವ ಲೈವ್ ಅನುವಾದ ವೈಶಿಷ್ಟ್ಯವು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 150ms TTFT ಮತ್ತು 130 ಟೋಕನ್ಗಳನ್ನು ಸಾಧಿಸುತ್ತದೆ, ಒಟ್ಟು 0.77 ಸೆಕೆಂಡುಗಳಲ್ಲಿ 50-ಪದ ವಾಕ್ಯವನ್ನು (ಸುಮಾರು 80 ಟೋಕನ್ಗಳ ಔಟ್ಪುಟ್) ಅನುವಾದಿಸುತ್ತದೆ. ಈ ಉಪ-ಸೆಕೆಂಡ್ ಲೇಟೆನ್ಸಿ ನೈಸರ್ಗಿಕ ಸಂಭಾಷಣೆಯ ವೇಗವನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ. ಬದಲಿಗೆ GPT-4o ಅನ್ನು ಬಳಸುವುದು 200ms TTFT ಅನ್ನು ಸೇರಿಸುತ್ತದೆ ಮತ್ತು ಥ್ರೋಪುಟ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಸಂಭಾಷಣೆಯ ಹರಿವನ್ನು ಮುರಿಯುವ ಗಮನಾರ್ಹ ವಿರಾಮಗಳನ್ನು ರಚಿಸುತ್ತದೆ.
ವ್ಯಾಪಾರ ಮತ್ತು ಹಣಕಾಸು ವಿಶ್ಲೇಷಣಾ ವೇದಿಕೆಗಳು ನೈಜ-ಸಮಯದ ಮಾರುಕಟ್ಟೆ ವ್ಯಾಖ್ಯಾನ ಮತ್ತು ಎಚ್ಚರಿಕೆಯ ಉತ್ಪಾದನೆಗಾಗಿ LLM ಗಳನ್ನು ಬಳಸುತ್ತವೆ. ಸುಪ್ತತೆಯು ಮಾರುಕಟ್ಟೆ-ಚಲಿಸುವ ಮಾಹಿತಿಯ ಮೌಲ್ಯವನ್ನು ನೇರವಾಗಿ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ. 100-ಟೋಕನ್ ಮಾರುಕಟ್ಟೆ ಎಚ್ಚರಿಕೆಗಳಿಗಾಗಿ GPT-4o-mini ಬಳಸುವ ಹಣಕಾಸು ವೇದಿಕೆಯು 1 ಸೆಕೆಂಡಿನೊಳಗೆ ವಿತರಣೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ, ಸಮಯ-ಸೂಕ್ಷ್ಮ ಹಣಕಾಸಿನ ಮಾಹಿತಿಯ ಅಗತ್ಯವನ್ನು ಪೂರೈಸುತ್ತದೆ. ಪ್ಲಾಟ್ಫಾರ್ಮ್ ದೀರ್ಘ ವಿಶ್ಲೇಷಣಾತ್ಮಕ ತುಣುಕುಗಳನ್ನು GPT-4o ಗೆ ದಾರಿ ಮಾಡುತ್ತದೆ, ಅಲ್ಲಿ ಸುಪ್ತತೆ ಕಡಿಮೆ ನಿರ್ಣಾಯಕವಾಗಿದೆ.
ಧ್ವನಿ ಸಹಾಯಕರು ಮತ್ತು ಧ್ವನಿ-ಸಕ್ರಿಯಗೊಳಿಸಿದ AI ಅಪ್ಲಿಕೇಶನ್ಗಳು ಕಟ್ಟುನಿಟ್ಟಾದ ಲೇಟೆನ್ಸಿ ಬಜೆಟ್ಗಳನ್ನು ಹೊಂದಿವೆ ಏಕೆಂದರೆ ಬಳಕೆದಾರರು ತಕ್ಷಣದ ಮೌಖಿಕ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ನಿರೀಕ್ಷಿಸುತ್ತಾರೆ. ಸ್ಪೀಚ್-ಟು-ಟೆಕ್ಸ್ಟ್ (300 ರಿಂದ 500 ಎಂಎಸ್) ನಿಂದ ಎಲ್ಎಲ್ಎಂ ಪೀಳಿಗೆಯಿಂದ ಪಠ್ಯದಿಂದ ಭಾಷಣಕ್ಕೆ (200 ರಿಂದ 400 ಎಂಎಸ್) ಒಟ್ಟು ಪೈಪ್ಲೈನ್ 2 ರಿಂದ 3 ಸೆಕೆಂಡುಗಳ ಒಳಗೆ ಪೂರ್ಣಗೊಳ್ಳಬೇಕು. ಇದು LLM ಉತ್ಪಾದನೆಗೆ ಕೇವಲ 1 ರಿಂದ 2 ಸೆಕೆಂಡುಗಳನ್ನು ಬಿಟ್ಟು, ಮಾದರಿ ಆಯ್ಕೆ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆಯ ಉದ್ದವನ್ನು ನಿರ್ಬಂಧಿಸುತ್ತದೆ. ಅನೇಕ ಧ್ವನಿ ಅಪ್ಲಿಕೇಶನ್ಗಳು ತಮ್ಮ ವೇಗವಾದ TTFT ಗಾಗಿ ನಿರ್ದಿಷ್ಟವಾಗಿ GPT-4o-mini ಅಥವಾ Claude Haiku ಅನ್ನು ಬಳಸುತ್ತವೆ.
Special Cases
▾
o1 ಮತ್ತು o3 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳಿಗಾಗಿ, TTFT ವಿಸ್ತೃತ ಚಿಂತನೆಯನ್ನು ಒಳಗೊಂಡಿದೆ
o1 ಮತ್ತು o3 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳಿಗಾಗಿ, TTFT ವಿಸ್ತೃತ ಚಿಂತನೆಯ ಹಂತವನ್ನು ಒಳಗೊಂಡಿದೆ, ಇದು ಸಮಸ್ಯೆಯ ಸಂಕೀರ್ಣತೆಯನ್ನು ಅವಲಂಬಿಸಿ 2 ರಿಂದ 30 ಸೆಕೆಂಡುಗಳವರೆಗೆ ಇರುತ್ತದೆ. ಈ ಚಿಂತನೆಯ ಸಮಯವನ್ನು ಔಟ್ಪುಟ್ ಟೋಕನ್ ದರದಲ್ಲಿ ವಿಧಿಸಲಾಗುತ್ತದೆ ಆದರೆ ಸ್ಟ್ರೀಮ್ ಮಾಡಿದ ಪ್ರತಿಕ್ರಿಯೆಯಲ್ಲಿ ಗೋಚರಿಸುವುದಿಲ್ಲ. 200 ಗೋಚರ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ವಿನಂತಿಯು 2,000 ರಿಂದ 5,000 ಥಿಂಕಿಂಗ್ ಟೋಕನ್ಗಳನ್ನು ಸೇವಿಸಿರಬಹುದು, ಇದು ಲೇಟೆನ್ಸಿ ಪೆನಾಲ್ಟಿ ಮತ್ತು ಗುಪ್ತ ವೆಚ್ಚ ಗುಣಕ ಎರಡನ್ನೂ ಸೃಷ್ಟಿಸುತ್ತದೆ. ಚಿಂತನೆಯ ಸಮಯವು ಅಳೆಯಬಹುದಾದ ಉತ್ತಮ ಫಲಿತಾಂಶಗಳನ್ನು ಉಂಟುಮಾಡುವ ಕಾರ್ಯಗಳಿಗಾಗಿ ಮಾತ್ರ ತಾರ್ಕಿಕ ಮಾದರಿಗಳನ್ನು ಬಳಸಬೇಕು.
ಜಾಗತಿಕ CDN ಅಥವಾ API ಗೇಟ್ವೇ ಹಿಂದೆ LLM ಗಳನ್ನು ನಿಯೋಜಿಸುವಾಗ, ಸೇರಿಸಲಾದ ನೆಟ್ವರ್ಕ್ ಹಾಪ್ ಆಗುತ್ತದೆ
ಜಾಗತಿಕ CDN ಅಥವಾ API ಗೇಟ್ವೇ ಹಿಂದೆ LLM ಗಳನ್ನು ನಿಯೋಜಿಸುವಾಗ, ಸೇರಿಸಲಾದ ನೆಟ್ವರ್ಕ್ ಹಾಪ್ಗಳು ಪ್ರತಿ ವಿನಂತಿಗೆ 10 ರಿಂದ 50ms ಹೆಚ್ಚುವರಿ ಲೇಟೆನ್ಸಿಯನ್ನು ಪರಿಚಯಿಸುತ್ತವೆ. ಪ್ರತ್ಯೇಕವಾಗಿ ಚಿಕ್ಕದಾಗಿದ್ದರೂ, 5 ರಿಂದ 15 ಅನುಕ್ರಮ LLM ಕರೆಗಳನ್ನು ಮಾಡುವ ಏಜೆಂಟ್ ಅಪ್ಲಿಕೇಶನ್ಗಳಲ್ಲಿ ಈ ಓವರ್ಹೆಡ್ ಸಂಯುಕ್ತಗಳು. 10 ಅನುಕ್ರಮ ಕರೆಗಳನ್ನು ಹೊಂದಿರುವ ಏಜೆಂಟ್ ಪೈಪ್ಲೈನ್ 100 ರಿಂದ 500ms ಗೇಟ್ವೇ ಓವರ್ಹೆಡ್ ಅನ್ನು ಮಾತ್ರ ಸಂಗ್ರಹಿಸುತ್ತದೆ. ಲೇಟೆನ್ಸಿ-ಸೆನ್ಸಿಟಿವ್ ಏಜೆಂಟ್ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗಾಗಿ, ಆರ್ಕೆಸ್ಟ್ರೇಟರ್ ಮತ್ತು LLM API ಎಂಡ್ಪಾಯಿಂಟ್ ನಡುವೆ ನೆಟ್ವರ್ಕ್ ಹಾಪ್ಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಿ.
ಫಂಕ್ಷನ್ ಕರೆ ಮತ್ತು ಟೂಲ್ ಬಳಕೆಯು ಸುಪ್ತತೆಯನ್ನು ಸೇರಿಸುತ್ತದೆ ಏಕೆಂದರೆ ಮಾದರಿಯು ರಚಿಸಬೇಕು
ಫಂಕ್ಷನ್ ಕರೆ ಮತ್ತು ಟೂಲ್ ಬಳಕೆಯು ಸುಪ್ತತೆಯನ್ನು ಸೇರಿಸುತ್ತದೆ ಏಕೆಂದರೆ ಮಾದರಿಯು ರಚನಾತ್ಮಕ JSON ಔಟ್ಪುಟ್ ಅನ್ನು ರಚಿಸಬೇಕು (ಇದು ನೈಸರ್ಗಿಕ ಭಾಷೆಗಿಂತ ನಿಧಾನವಾಗಿರುತ್ತದೆ) ಮತ್ತು ನಂತರ ಮುಂದುವರೆಯುವ ಮೊದಲು ಟೂಲ್ ಫಲಿತಾಂಶಕ್ಕಾಗಿ ಕಾಯಿರಿ. ಪ್ರತಿಯೊಂದು ಟೂಲ್ ಕರೆ ರೌಂಡ್-ಟ್ರಿಪ್ ಪೂರ್ಣ TTFT ಜೊತೆಗೆ ಟೂಲ್ ಎಕ್ಸಿಕ್ಯೂಶನ್ ಸಮಯವನ್ನು ಸೇರಿಸುತ್ತದೆ. 3 ಟೂಲ್ ಕರೆಗಳನ್ನು ಮಾಡುವ ಏಜೆಂಟ್ ಸರಿಸುಮಾರು 1 ರಿಂದ 3 ಸೆಕೆಂಡುಗಳ LLM ಲೇಟೆನ್ಸಿ ಜೊತೆಗೆ ಬಾಹ್ಯ ಉಪಕರಣದ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವನ್ನು ಸೇರಿಸುತ್ತದೆ. ಸಾಧ್ಯವಿರುವಲ್ಲಿ ಒಂದೇ ಟೂಲ್ ಕರೆಗಳಲ್ಲಿ ಬಹು ಪ್ರಶ್ನೆಗಳನ್ನು ಬ್ಯಾಚ್ ಮಾಡುವ ಮೂಲಕ ರೌಂಡ್-ಟ್ರಿಪ್ಗಳನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಟೂಲ್ ಇಂಟರ್ಫೇಸ್ಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿ.
LLM ಲೇಟೆನ್ಸಿ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು (2025 ಸರಾಸರಿ ಮೌಲ್ಯಗಳು)
▾
| ಮಾದರಿ | TTFT (ಮಧ್ಯಮ) | ಟೋಕನ್ಗಳು/ಸೆಕೆಂಡ್ | 200-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆ | 500-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆ |
|---|---|---|---|---|
| GPT-4o | 350ms | 100 ಟೋಕ್/ಸೆ | 2.35 ಸೆ | 5.35ಸೆ |
| GPT-4o-ಮಿನಿ | 150 ಎಂಎಸ್ | 130 ಟಾಕ್/ಸೆ | 1.69 ಸೆ | 4.00 ಸೆ |
| ಕ್ಲೌಡ್ ಸಾನೆಟ್ 4 | 500ms | 80 tok/s | 3.00 ಸೆ | 6.75 ಸೆ |
| ಕ್ಲೌಡ್ ಹೈಕು | 200ms | 120 ಟಾಕ್/ಸೆ | 1.87ಸೆ | 4.37ಸೆ |
| ಜೆಮಿನಿ 1.5 ಫ್ಲ್ಯಾಶ್ | 200ms | 140 ಟಾಕ್/ಸೆ | 1.63 ಸೆ | 3.77ಸೆ |
| o1 (ತಾರ್ಕಿಕ) | 3,000ms | 50 ಟೋಕ್/ಸೆ | 7.00 ಸೆ | 13.00 ಸೆ |
| ಲಾಮಾ 3 70B (H100) | 100ms | 90 ಟೋಕ್/ಸೆ | 2.32ಸೆ | 5.66 ಸೆ |
Frequently Asked Questions
▾
ಯಾವ LLM ಕಡಿಮೆ ಸುಪ್ತತೆಯನ್ನು ಹೊಂದಿದೆ?
ಪ್ರಮುಖ ವಾಣಿಜ್ಯ ಮಾದರಿಗಳಲ್ಲಿ, GPT-4o-mini 100 ರಿಂದ 200ms TTFT ಮತ್ತು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ 120 ರಿಂದ 150 ಟೋಕನ್ಗಳೊಂದಿಗೆ ಕಡಿಮೆ ಸುಪ್ತತೆಯನ್ನು ಸ್ಥಿರವಾಗಿ ನೀಡುತ್ತದೆ. ಕ್ಲೌಡ್ ಹೈಕು ಇದೇ ವೇಗವಾಗಿದೆ. ಪ್ರಮುಖ ಮಾದರಿಗಳಲ್ಲಿ, GPT-4o ಕ್ಲೌಡ್ ಸಾನೆಟ್ 4 ಗಿಂತ ಸ್ವಲ್ಪ ವೇಗವಾಗಿರುತ್ತದೆ. o1 ನಂತಹ ತಾರ್ಕಿಕ ಮಾದರಿಗಳು 2 ರಿಂದ 10 ಸೆಕೆಂಡುಗಳ TTFT ಯೊಂದಿಗೆ ಆಂತರಿಕ ಚಿಂತನೆಯ ಕಾರಣದಿಂದಾಗಿ ಗಮನಾರ್ಹವಾಗಿ ನಿಧಾನವಾಗಿರುತ್ತವೆ. H100 GPU ಗಳಲ್ಲಿ ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಲಾದ ಮಾದರಿಗಳು ಉಪ-100ms TTFT ಅನ್ನು ಸಾಧಿಸಬಹುದು ಆದರೆ ಗಮನಾರ್ಹ ಮೂಲಸೌಕರ್ಯ ಹೂಡಿಕೆಯ ಅಗತ್ಯವಿರುತ್ತದೆ.
ಪ್ರಾಂಪ್ಟ್ ಉದ್ದವು ಸುಪ್ತತೆಯ ಮೇಲೆ ಹೇಗೆ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ?
ದೀರ್ಘವಾದ ಇನ್ಪುಟ್ ಪ್ರಾಂಪ್ಟ್ಗಳು TTFT ಅನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ ಏಕೆಂದರೆ ಮೊದಲ ಔಟ್ಪುಟ್ ಟೋಕನ್ ಅನ್ನು ಉತ್ಪಾದಿಸುವ ಮೊದಲು ಮಾದರಿಯು ಎಲ್ಲಾ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಬೇಕು. ಕನಿಷ್ಠ ಪ್ರಾಂಪ್ಟ್ಗೆ ಹೋಲಿಸಿದರೆ 1,000 ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದು ಸಾಮಾನ್ಯವಾಗಿ 100 ರಿಂದ 300ms ಅನ್ನು ಸೇರಿಸುತ್ತದೆ. 10,000 ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದರಿಂದ 500 ರಿಂದ 1,500ms ಅನ್ನು ಸೇರಿಸಬಹುದು. ಇದಕ್ಕಾಗಿಯೇ ದೊಡ್ಡ ಹಿಂಪಡೆಯಲಾದ ಸಂದರ್ಭವನ್ನು ಹೊಂದಿರುವ RAG ಅಪ್ಲಿಕೇಶನ್ಗಳು ಸರಳ ಚಾಟ್ಬಾಟ್ ಸಂವಹನಗಳಿಗಿಂತ ಹೆಚ್ಚಿನ ಸುಪ್ತತೆಯನ್ನು ಹೊಂದಿವೆ. ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ (ಆಂಥ್ರೊಪಿಕ್ನಿಂದ ಲಭ್ಯವಿದೆ) ಪುನರಾವರ್ತಿತ ಪ್ರಾಂಪ್ಟ್ ಪೂರ್ವಪ್ರತ್ಯಯಗಳಿಗಾಗಿ ಈ ಪ್ರಕ್ರಿಯೆಯ ಸಮಯವನ್ನು ತೆಗೆದುಹಾಕುತ್ತದೆ.
ನಾನು ಎಲ್ಲಾ API ಕರೆಗಳಿಗೆ ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಬಳಸಬೇಕೇ?
ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಉತ್ಪಾದಿಸಲು 1 ಸೆಕೆಂಡ್ಗಿಂತ ಹೆಚ್ಚು ತೆಗೆದುಕೊಳ್ಳುವ ಯಾವುದೇ ಬಳಕೆದಾರ-ಮುಖದ ಪ್ರತಿಕ್ರಿಯೆಗಾಗಿ ಬಳಸಬೇಕು. ಪ್ರೋಗ್ರಾಮ್ಯಾಟಿಕ್ API ಕರೆಗಳಿಗೆ ಔಟ್ಪುಟ್ ಅನ್ನು ಬಳಕೆದಾರರಿಗೆ ಪ್ರದರ್ಶಿಸುವ ಬದಲು ಕೋಡ್ ಮೂಲಕ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲಾಗುತ್ತದೆ, ಸ್ಟ್ರೀಮಿಂಗ್ ಅಲ್ಲದಿರುವುದು ಸರಳವಾಗಿದೆ ಮತ್ತು ಅತ್ಯಲ್ಪ ಲೇಟೆನ್ಸಿ ಪ್ರಯೋಜನವನ್ನು ಹೊಂದಿದೆ. ಸ್ಟ್ರೀಮಿಂಗ್ ಹೆಚ್ಚಿನ SDK ಗಳೊಂದಿಗೆ ಕನಿಷ್ಠ ಕೋಡ್ ಸಂಕೀರ್ಣತೆಯನ್ನು ಸೇರಿಸುತ್ತದೆ ಮತ್ತು ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವಿಲ್ಲದೆ ಎಲ್ಲಾ ಪ್ರಮುಖ ಪೂರೈಕೆದಾರರಿಂದ ಬೆಂಬಲಿತವಾಗಿದೆ. ಸ್ಟ್ರೀಮಿಂಗ್ನಿಂದ ಗ್ರಹಿಸಿದ ಲೇಟೆನ್ಸಿ ಸುಧಾರಣೆಯು ಗಣನೀಯವಾಗಿದೆ: ಸ್ಟ್ರೀಮ್ ಮಾಡಿದಾಗ 10-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಯು 1 ಸೆಕೆಂಡ್ನಂತೆ ಭಾಸವಾಗುತ್ತದೆ.
ನನ್ನ ಅಪ್ಲಿಕೇಶನ್ಗಾಗಿ ನಾನು TTFT ಅನ್ನು ಹೇಗೆ ಕಡಿಮೆ ಮಾಡುವುದು?
ಪ್ರಮುಖ TTFT ಆಪ್ಟಿಮೈಸೇಶನ್ಗಳು ಸೇರಿವೆ: ಪುನರಾವರ್ತಿತ ಪ್ರಾಂಪ್ಟ್ ಪೂರ್ವಪ್ರತ್ಯಯಗಳ ಸಂಸ್ಕರಣೆಯನ್ನು ಬಿಟ್ಟುಬಿಡಲು ಪ್ರಾಂಪ್ಟ್ ಕ್ಯಾಶಿಂಗ್ ಅನ್ನು ಬಳಸುವುದು (200 ರಿಂದ 500ms ಉಳಿಸುತ್ತದೆ), ಭೌಗೋಳಿಕವಾಗಿ ಹತ್ತಿರವಿರುವ API ಅಂತಿಮ ಬಿಂದುಗಳನ್ನು ಆರಿಸುವುದು (ನೆಟ್ವರ್ಕ್ ರೌಂಡ್-ಟ್ರಿಪ್ನ 50 ರಿಂದ 200ms ಉಳಿಸುತ್ತದೆ), ಇನ್ಪುಟ್ ಪ್ರಾಂಪ್ಟ್ ಉದ್ದವನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು ಮತ್ತು ಮಾದರಿಗಳನ್ನು 500 ನಂತೆ ಉಳಿಸುತ್ತದೆ. GPT-4o-mini (GPT-4o ವಿರುದ್ಧ 100 ರಿಂದ 300ms ಉಳಿಸುತ್ತದೆ). ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಲಾದ ಮಾದರಿಗಳಿಗಾಗಿ, vLLM ನಂತಹ ಆಪ್ಟಿಮೈಸ್ಡ್ ಸರ್ವಿಂಗ್ ಫ್ರೇಮ್ವರ್ಕ್ಗಳೊಂದಿಗೆ GPU-ವೇಗವರ್ಧಿತ ನಿರ್ಣಯವು ಉಪ-100ms TTFT ಅನ್ನು ಸಾಧಿಸಬಹುದು.
ವಿವಿಧ ಅಪ್ಲಿಕೇಶನ್ ಪ್ರಕಾರಗಳಿಗೆ ಸ್ವೀಕಾರಾರ್ಹ ಲೇಟೆನ್ಸಿ ಯಾವುದು?
ಹುಡುಕಾಟ ಮತ್ತು ಸ್ವಯಂಪೂರ್ಣತೆ: 500ms ಅಡಿಯಲ್ಲಿ. ಚಾಟ್ಬಾಟ್ ಪ್ರತಿಕ್ರಿಯೆಗಳು: 3 ಸೆಕೆಂಡುಗಳಲ್ಲಿ (ಸ್ಟ್ರೀಮಿಂಗ್ನೊಂದಿಗೆ). ವಿಷಯ ಉತ್ಪಾದನೆ: 10 ಸೆಕೆಂಡುಗಳಿಗಿಂತ ಕಡಿಮೆ (ಸ್ಟ್ರೀಮಿಂಗ್ ಪ್ರಗತಿ ಸೂಚಕದೊಂದಿಗೆ). ಬ್ಯಾಚ್ ಪ್ರಕ್ರಿಯೆ: ನಿಮಿಷಗಳಿಂದ ಗಂಟೆಗಳವರೆಗೆ (ಯಾವುದೇ ಲೇಟೆನ್ಸಿ ಅಗತ್ಯವಿಲ್ಲ). ಧ್ವನಿ ಸಹಾಯಕರು: 2 ಸೆಕೆಂಡುಗಳಲ್ಲಿ ಒಟ್ಟು ಪೈಪ್ಲೈನ್. ಕೋಡ್ ಪೂರ್ಣಗೊಳಿಸುವಿಕೆ: ಇನ್ಲೈನ್ ಸಲಹೆಗಳಿಗಾಗಿ 500ms ಅಡಿಯಲ್ಲಿ. ಈ ಮಿತಿಗಳು ಬಳಕೆದಾರರ ಅನುಭವ ಸಂಶೋಧನೆ ಮತ್ತು ಸ್ಪರ್ಧಾತ್ಮಕ ಮಾನದಂಡಗಳನ್ನು ಆಧರಿಸಿವೆ.
Common Mistakes to Avoid
▾
- !ಲೇಟೆನ್ಸಿ ಇಂಪ್ಯಾಕ್ಟ್ ಅನ್ನು ನಿರ್ಲಕ್ಷಿಸುವಾಗ ಟೋಕನ್ ವೆಚ್ಚಕ್ಕೆ ಮಾತ್ರ ಆಪ್ಟಿಮೈಜ್ ಮಾಡುವುದು:
- !ದೀರ್ಘ ಪ್ರತಿಕ್ರಿಯೆಗಳಿಗಾಗಿ ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಬಳಸದಿರುವುದು:
- !TTFT ವ್ಯತ್ಯಾಸ ಮತ್ತು P99 ಸುಪ್ತತೆಯನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತಿದೆ:
Pro Tip
ನಿಮ್ಮ ಸಂಪೂರ್ಣ ವಿನಂತಿಯ ಪೈಪ್ಲೈನ್ಗಾಗಿ ಲೇಟೆನ್ಸಿ ಬಜೆಟ್ ಅನ್ನು ಅಳವಡಿಸಿ ಮತ್ತು ಅದನ್ನು ಘಟಕಗಳಾದ್ಯಂತ ನಿಯೋಜಿಸಿ. 3-ಸೆಕೆಂಡ್ ಚಾಟ್ಬಾಟ್ ಬಜೆಟ್ಗಾಗಿ: ನೆಟ್ವರ್ಕ್ ಮತ್ತು ಪ್ರಿಪ್ರೊಸೆಸಿಂಗ್ಗಾಗಿ 200ms, RAG ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ 200ms, TTFT ಗಾಗಿ 300ms ಮತ್ತು ಟೋಕನ್ ಉತ್ಪಾದನೆಗೆ 2,300ms (GPT-4o-mini ನಲ್ಲಿ 130 tok/s ನಲ್ಲಿ ಸುಮಾರು 300 ಟೋಕನ್ಗಳನ್ನು ಅನುಮತಿಸುತ್ತದೆ). ಈ ಬಜೆಟ್ ವಿಧಾನವು ಪ್ರತ್ಯೇಕ ಘಟಕಗಳನ್ನು ಅವುಗಳ ಪಾಲುಗಿಂತ ಹೆಚ್ಚಿನದನ್ನು ಸೇವಿಸುವುದನ್ನು ತಡೆಯುತ್ತದೆ ಮತ್ತು ಒಂದು ಘಟಕಕ್ಕೆ ಆಪ್ಟಿಮೈಸೇಶನ್ ಅಗತ್ಯವಿರುವಾಗ ಅಥವಾ ವೇಗವಾದ ಮಾದರಿಯ ಅಗತ್ಯವಿರುವಾಗ ಹೈಲೈಟ್ ಮಾಡುತ್ತದೆ.
Did you know?
ಮಾನವ ಸಂಭಾಷಣೆಯ ತಿರುವು-ತೆಗೆದುಕೊಳ್ಳುವಿಕೆಯು ಒಬ್ಬ ವ್ಯಕ್ತಿಯು ಮುಗಿಸುವ ಮತ್ತು ಇನ್ನೊಬ್ಬರು ಮಾತನಾಡಲು ಪ್ರಾರಂಭಿಸುವ ನಡುವೆ ಸುಮಾರು 200 ಮಿಲಿಸೆಕೆಂಡುಗಳ ನೈಸರ್ಗಿಕ ಅಂತರವನ್ನು ಹೊಂದಿರುತ್ತದೆ. AI ಚಾಟ್ಬಾಟ್ ಪ್ರತಿಕ್ರಿಯೆ ಸಮಯವು 3 ಸೆಕೆಂಡುಗಳನ್ನು ಮೀರಿದಾಗ, ಬಳಕೆದಾರರು ಅರಿವಿಲ್ಲದೆ 'ಸಂಭಾಷಣೆ' ಮಾನಸಿಕ ಮಾದರಿಯ ಬದಲಿಗೆ 'ವೆಬ್ ಹುಡುಕಾಟ' ಮಾನಸಿಕ ಮಾದರಿಯನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುತ್ತಾರೆ, ಕಡಿಮೆ ತೊಡಗಿಸಿಕೊಳ್ಳುತ್ತಾರೆ ಮತ್ತು ತ್ಯಜಿಸುವ ಸಾಧ್ಯತೆ ಹೆಚ್ಚು. ಉಪ-2-ಸೆಕೆಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಸಾಧಿಸುವುದು ಬಳಕೆದಾರರನ್ನು ಸಂಭಾಷಣೆಯ ಮನಸ್ಥಿತಿಯಲ್ಲಿ ಇರಿಸುತ್ತದೆ, ತೊಡಗಿಸಿಕೊಳ್ಳುವಿಕೆ ಮತ್ತು ತೃಪ್ತಿಯ ಸ್ಕೋರ್ಗಳನ್ನು 25 ರಿಂದ 40 ಪ್ರತಿಶತದಷ್ಟು ಹೆಚ್ಚಿಸುತ್ತದೆ.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
References
ಸಾಪ್ತಾಹಿಕ ಗಣಿತ ಸಲಹೆಗಳನ್ನು ಪಡೆಯಿರಿ
ಪ್ರತಿ ವಾರ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಸಲಹೆಗಳನ್ನು ಪಡೆಯುವ 12,000+ ಚಂದಾದಾರರನ್ನು ಸೇರಿ.