Skip to content
Skip to main content
DigiCalcs

ವಿಶೇಷ

LLM Embedding Cost Calculator

What is LLM Embedding Cost Calculator?

▾

LLM ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ವಾಣಿಜ್ಯ API ಮಾದರಿಗಳಾದ OpenAI ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಚಿಕ್ಕ, ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಲಾರ್ಜ್, ಮತ್ತು ಲೆಗಸಿ ada-002 ಅನ್ನು ಬಳಸಿಕೊಂಡು ಪಠ್ಯ ಡೇಟಾಕ್ಕಾಗಿ ವೆಕ್ಟರ್ ಎಂಬೆಡಿಂಗ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುವ ಒಟ್ಟು ವೆಚ್ಚವನ್ನು ಅಂದಾಜು ಮಾಡುತ್ತದೆ. ಎಂಬೆಡಿಂಗ್‌ಗಳು ಪಠ್ಯವನ್ನು ದಟ್ಟವಾದ ಸಂಖ್ಯಾತ್ಮಕ ವೆಕ್ಟರ್‌ಗಳಾಗಿ ಪರಿವರ್ತಿಸುತ್ತವೆ (ಸಾಮಾನ್ಯವಾಗಿ 256 ರಿಂದ 3072 ಆಯಾಮಗಳು) ಅದು ಶಬ್ದಾರ್ಥದ ಅರ್ಥವನ್ನು ಸೆರೆಹಿಡಿಯುತ್ತದೆ, ಹೋಲಿಕೆ ಹುಡುಕಾಟ, ಕ್ಲಸ್ಟರಿಂಗ್ ಮತ್ತು ಮರುಪಡೆಯುವಿಕೆ-ವರ್ಧಿತ ಪೀಳಿಗೆಯ (RAG) ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ. 2025 ರ ಹೊತ್ತಿಗೆ, OpenAI ಬೆಲೆಗಳು ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.02 ಮತ್ತು ಪಠ್ಯ-ಎಂಬೆಡ್ಡಿಂಗ್-3-ದೊಡ್ಡದು ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.13, ಆದರೆ ಹಳೆಯ ada-002 ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.10 ನಲ್ಲಿ ಲಭ್ಯವಿದೆ. ಪರ್ಯಾಯಗಳು ಕೋಹೆರ್ ಎಂಬೆಡ್ v3 ಅನ್ನು ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ ಸರಿಸುಮಾರು $0.10 ಮತ್ತು BGE, E5 ಮತ್ತು GTE ಯಂತಹ ಉಚಿತ ಮುಕ್ತ-ಮೂಲ ಮಾದರಿಗಳನ್ನು ಒಳಗೊಂಡಿರುತ್ತವೆ, ಅವುಗಳು ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಿದ GPU ಮೂಲಸೌಕರ್ಯ ಅಗತ್ಯವಿರುತ್ತದೆ. ಈ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಅನ್ನು ಮೆಷಿನ್ ಲರ್ನಿಂಗ್ ಇಂಜಿನಿಯರ್‌ಗಳು ಸೆಮ್ಯಾಂಟಿಕ್ ಸರ್ಚ್ ಸಿಸ್ಟಮ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಾರೆ, AI-ಚಾಲಿತ ಶಿಫಾರಸುಗಳನ್ನು ಸೇರಿಸುವ ಉತ್ಪನ್ನ ತಂಡಗಳು ಮತ್ತು ಮಾದರಿಗಳನ್ನು ನವೀಕರಿಸಿದಾಗ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಮರು ಎಂಬೆಡ್ ಮಾಡಬೇಕಾದ ETL ಪೈಪ್‌ಲೈನ್‌ಗಳನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸುವ ಡೇಟಾ ಎಂಜಿನಿಯರ್‌ಗಳು ಪ್ರತಿದಿನ ಬಳಸುತ್ತಾರೆ. 500 ಟೋಕನ್‌ಗಳಲ್ಲಿ ಒಂದು ಮಿಲಿಯನ್ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳ ವಿಶಿಷ್ಟ ಎಂಟರ್‌ಪ್ರೈಸ್ ಜ್ಞಾನ ಬೇಸ್ ಪ್ರತಿಯೊಂದೂ ಒಟ್ಟು 500 ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳನ್ನು ಹೊಂದಿದೆ, ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣ ಜೊತೆಗೆ ಕೇವಲ $10 ಆದರೆ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ದೊಡ್ಡದರೊಂದಿಗೆ $65 ವೆಚ್ಚವಾಗುತ್ತದೆ. ಸರಿಯಾದ ಗುಣಮಟ್ಟದ-ವೆಚ್ಚದ ಅನುಪಾತವನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ಈ ವೆಚ್ಚ ವ್ಯತ್ಯಾಸಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಅತ್ಯಗತ್ಯ. ಕಚ್ಚಾ ಎಂಬೆಡಿಂಗ್ API ವೆಚ್ಚದ ಹೊರತಾಗಿ, ಈ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಓವರ್‌ಹೆಡ್ ಚಂಕಿಂಗ್ (ಅತಿಕ್ರಮಿಸುವ ಚಂಕ್‌ಗಳು ಟೋಕನ್ ಎಣಿಕೆಗಳನ್ನು 10 ರಿಂದ 30 ಪ್ರತಿಶತದಷ್ಟು ಹೆಚ್ಚಿಸಬಹುದು), ಡಾಕ್ಯುಮೆಂಟ್ ನವೀಕರಣಗಳಿಗಾಗಿ ಮರು-ಎಂಬೆಡ್ ಮಾಡುವ ಆವರ್ತನ ಮತ್ತು Pinecone, Weaviate, ಅಥವಾ pgvector ನಂತಹ ಡೇಟಾಬೇಸ್‌ನಲ್ಲಿ ವೆಕ್ಟರ್‌ಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಪೂರಕ ವೆಚ್ಚವನ್ನು ಸಹ ಒಳಗೊಂಡಿದೆ. ಪೂರ್ಣ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಮಾಡೆಲಿಂಗ್ ಮಾಡುವ ಮೂಲಕ, ತಂಡಗಳು ಮಾದರಿ ಆಯ್ಕೆ, ಚಂಕ್ ಗಾತ್ರಗಳು ಮತ್ತು ಡೇಟಾ ವಾಲ್ಯೂಮ್‌ಗಳು ಬೆಳೆದಂತೆ ವೆಚ್ಚವನ್ನು ಊಹಿಸಬಹುದಾದ ಅಪ್‌ಡೇಟ್‌ಗಳ ಬಗ್ಗೆ ತಿಳುವಳಿಕೆಯುಳ್ಳ ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಬಹುದು.

DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.

ಸೂತ್ರ

▾
f(x)ಒಟ್ಟು ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚ = (ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳ ಸಂಖ್ಯೆ x ಪ್ರತಿ ಡಾಕ್ಯುಮೆಂಟ್‌ಗೆ ಸರಾಸರಿ ಟೋಕನ್‌ಗಳು x (1 + ಅತಿಕ್ರಮಣ ಅನುಪಾತ)) / 1M ಟೋಕನ್‌ಗಳಿಗೆ 1,000,000 x ಬೆಲೆ. ಉದಾಹರಣೆಗೆ, 200,000 ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು 400 ಟೋಕನ್‌ಗಳಲ್ಲಿ ಎಂಬೆಡ್ ಮಾಡುವುದು ಪ್ರತಿ 1M ಟೋಕನ್‌ಗಳಿಗೆ $0.02 ದರದಲ್ಲಿ ಟೆಕ್ಸ್ಟ್-ಎಂಬೆಡ್ಡಿಂಗ್-3-ಸ್ಮಾಲ್ ಅನ್ನು ಬಳಸಿಕೊಂಡು 15 ಪ್ರತಿಶತ ಅತಿಕ್ರಮಣದೊಂದಿಗೆ: ಒಟ್ಟು ಟೋಕನ್‌ಗಳು = 200,000 x 400 x 1.15 = 90,000, ವೆಚ್ಚ = (92,000,000 / 1,000,000) x $0.02 = 92 x $0.02 = $1.84.

Variable Legend

▾
ಚಿಹ್ನೆಹೆಸರುಘಟಕವಿವರಣೆ
Nದಾಖಲೆಗಳ ಸಂಖ್ಯೆdocumentsವೆಕ್ಟರ್ ಎಂಬೆಡಿಂಗ್‌ಗಳಾಗಿ ಪರಿವರ್ತಿಸಬೇಕಾದ ಪಠ್ಯ ದಾಖಲೆಗಳ ಒಟ್ಟು ಎಣಿಕೆ ಅಥವಾ ನಿಮ್ಮ ಕಾರ್ಪಸ್‌ನಲ್ಲಿ ಪೂರ್ವ-ಚಂಕ್ ಮಾಡಿದ ಪಠ್ಯ ವಿಭಾಗಗಳು.
T_avgಪ್ರತಿ ಡಾಕ್ಯುಮೆಂಟ್‌ಗೆ ಸರಾಸರಿ ಟೋಕನ್‌ಗಳುtokensಪ್ರತಿ ಡಾಕ್ಯುಮೆಂಟ್ ಅಥವಾ ಭಾಗಕ್ಕೆ ಟೋಕನ್‌ಗಳ ಸರಾಸರಿ ಸಂಖ್ಯೆ, ಸಾಮಾನ್ಯವಾಗಿ ನಿಖರವಾದ BPE ಟೋಕನ್ ಎಣಿಕೆಗಳಿಗಾಗಿ ಟಿಕ್‌ಟೋಕನ್ ಲೈಬ್ರರಿ ಅಥವಾ OpenAI ಟೋಕನೈಜರ್ ಉಪಕರಣವನ್ನು ಬಳಸಿಕೊಂಡು ಅಳೆಯಲಾಗುತ್ತದೆ.
Oಅತಿಕ್ರಮಣ ಅನುಪಾತratio (0 to 0.5)ಸ್ಲೈಡಿಂಗ್ ವಿಂಡೋ ಚಂಕಿಂಗ್ ತಂತ್ರದಲ್ಲಿ ಸತತ ಭಾಗಗಳ ನಡುವೆ ಹಂಚಲಾದ ಟೋಕನ್‌ಗಳ ಭಾಗ, ಸಾಮಾನ್ಯವಾಗಿ ಸಂದರ್ಭದ ನಿರಂತರತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಲು 0.10 ಮತ್ತು 0.25 ರ ನಡುವೆ ಹೊಂದಿಸಲಾಗಿದೆ.
Pಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ ಬೆಲೆUSD per 1M tokensಒಂದು ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲು ಎಂಬೆಡಿಂಗ್ API ಪೂರೈಕೆದಾರರಿಂದ ಶುಲ್ಕ ವಿಧಿಸಲಾಗುತ್ತದೆ, ಉದಾಹರಣೆಗೆ ಪಠ್ಯ ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣಗೆ $0.02 ಅಥವಾ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ದೊಡ್ಡದು $0.13.
Uಮಾಸಿಕ ನವೀಕರಣ ದರratio (0 to 1)ಕಾರ್ಪಸ್‌ನಲ್ಲಿರುವ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳ ಭಾಗವು ಪ್ರತಿ ತಿಂಗಳು ಸೇರಿಸಲಾಗುತ್ತದೆ, ಮಾರ್ಪಡಿಸಲಾಗುತ್ತದೆ ಅಥವಾ ಅಳಿಸಲಾಗುತ್ತದೆ, ವೆಕ್ಟರ್ ಇಂಡೆಕ್ಸ್ ಪ್ರಸ್ತುತವನ್ನು ಇರಿಸಿಕೊಳ್ಳಲು ಮರು-ಎಂಬೆಡ್ ಮಾಡುವ ಅಗತ್ಯವಿರುತ್ತದೆ.
Dವೆಕ್ಟರ್ ಆಯಾಮಗಳುdimensionsಪ್ರತಿ ಎಂಬೆಡಿಂಗ್ ವೆಕ್ಟರ್ ಔಟ್‌ಪುಟ್‌ನಲ್ಲಿನ ಆಯಾಮಗಳ ಸಂಖ್ಯೆ, ಇದು ಶೇಖರಣಾ ಅಗತ್ಯತೆಗಳು ಮತ್ತು ಹುಡುಕಾಟ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. ಸಾಮಾನ್ಯ ಮೌಲ್ಯಗಳು 256, 1536 ಮತ್ತು 3072.

How to LLM Embedding Cost Calculator

▾
  1. 1ನಿಮ್ಮ ಕಾರ್ಪಸ್‌ನಲ್ಲಿರುವ ಒಟ್ಟು ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳು ಅಥವಾ ಪಠ್ಯ ಭಾಗಗಳ ಸಂಖ್ಯೆಯನ್ನು ಎಣಿಸುವ ಮೂಲಕ ಪ್ರಾರಂಭಿಸಿ. ಇದು ಉತ್ಪನ್ನ ವಿವರಣೆಗಳು, ಬೆಂಬಲ ಲೇಖನಗಳು, PDF ಪುಟಗಳು ಅಥವಾ ನೀವು ಹುಡುಕಲು ಬಯಸುವ ಯಾವುದೇ ಪಠ್ಯ ಘಟಕವಾಗಿರಬಹುದು. ನೀವು ಇನ್ನೂ ತುಂಡು ಮಾಡದ ಕಚ್ಚಾ ದಾಖಲೆಗಳನ್ನು ಹೊಂದಿದ್ದರೆ, ನಿಮ್ಮ ಟಾರ್ಗೆಟ್ ಚಂಕ್ ಗಾತ್ರ (ಸಾಮಾನ್ಯವಾಗಿ 256 ರಿಂದ 512 ಟೋಕನ್‌ಗಳು) ಮತ್ತು ಅತಿಕ್ರಮಿಸುವ ಸೆಟ್ಟಿಂಗ್‌ಗಳ ಆಧಾರದ ಮೇಲೆ ಪ್ರತಿಯೊಂದೂ ಎಷ್ಟು ಭಾಗಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಅಂದಾಜು ಮಾಡಿ.
  2. 2ಪ್ರತಿ ಚಂಕ್‌ಗೆ ಸರಾಸರಿ ಟೋಕನ್ ಎಣಿಕೆಯನ್ನು ನಿರ್ಧರಿಸಿ. ಮಾದರಿ ದಾಖಲೆಗಳಿಗಾಗಿ ನಿಖರವಾದ ಟೋಕನ್ ಎಣಿಕೆಗಳನ್ನು ಅಳೆಯಲು ನೀವು OpenAI ಟೋಕನೈಜರ್ ಉಪಕರಣ ಅಥವಾ ಟಿಕ್ಟೋಕನ್ ಪೈಥಾನ್ ಲೈಬ್ರರಿಯನ್ನು ಬಳಸಬಹುದು. ಹೆಬ್ಬೆರಳಿನ ಒರಟು ನಿಯಮವೆಂದರೆ ಒಂದು ಟೋಕನ್ ಸರಿಸುಮಾರು ನಾಲ್ಕು ಇಂಗ್ಲಿಷ್ ಅಕ್ಷರಗಳು ಅಥವಾ 0.75 ಪದಗಳಿಗೆ ಸಮನಾಗಿರುತ್ತದೆ. ಬಹುಭಾಷಾ ಕಾರ್ಪೋರಾಗಾಗಿ, ಬೈಟ್-ಜೋಡಿ ಎನ್‌ಕೋಡಿಂಗ್ ಲ್ಯಾಟಿನ್ ಅಲ್ಲದ ಸ್ಕ್ರಿಪ್ಟ್‌ಗಳನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬ ಕಾರಣದಿಂದಾಗಿ ಟೋಕನ್ ಎಣಿಕೆಗಳು ಇಂಗ್ಲಿಷ್ ಸಮಾನತೆಗಳಿಗಿಂತ 1.5 ರಿಂದ 2 ಪಟ್ಟು ಹೆಚ್ಚಿರಬಹುದು.
  3. 3ನಿಮ್ಮ ಎಂಬೆಡಿಂಗ್ ಮಾದರಿಯನ್ನು ಆಯ್ಕೆಮಾಡಿ ಮತ್ತು ಅದರ ಬೆಲೆ ಶ್ರೇಣಿಯನ್ನು ಗಮನಿಸಿ. OpenAI ಟೆಕ್ಸ್ಟ್-ಎಂಬೆಡಿಂಗ್-3-ಸ್ಮಾಲ್ ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.02, ಪಠ್ಯ-ಎಂಬೆಡ್ಡಿಂಗ್-3-ಲಾರ್ಜ್ ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.13 ವೆಚ್ಚವಾಗುತ್ತದೆ ಮತ್ತು ada-002 ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.10 ವೆಚ್ಚವಾಗುತ್ತದೆ. ಸಣ್ಣ ಮಾದರಿಯು ಪೂರ್ವನಿಯೋಜಿತವಾಗಿ 1536-ಆಯಾಮದ ವೆಕ್ಟರ್‌ಗಳನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ (256 ಕ್ಕೆ ಕಾನ್ಫಿಗರ್ ಮಾಡಬಹುದು), ಆದರೆ ದೊಡ್ಡ ಮಾದರಿಯು 3072 ಆಯಾಮಗಳನ್ನು ನೀಡುತ್ತದೆ. ಹೆಚ್ಚಿನ ಆಯಾಮಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಹೆಚ್ಚಿನ ಸಂಗ್ರಹಣೆ ಮತ್ತು ನಿಧಾನವಾದ ಹೋಲಿಕೆಯ ಹುಡುಕಾಟಗಳ ವೆಚ್ಚದಲ್ಲಿ ಉತ್ತಮ ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟವನ್ನು ನೀಡುತ್ತದೆ.
  4. 4ನಿಮ್ಮ ಚಂಕಿಂಗ್ ಅತಿಕ್ರಮಣ ಅನುಪಾತವನ್ನು ಕಾನ್ಫಿಗರ್ ಮಾಡಿ. ಹೆಚ್ಚಿನ RAG ಅಳವಡಿಕೆಗಳು ಚಂಕ್ ಗಡಿಗಳಲ್ಲಿ ಸಂದರ್ಭವನ್ನು ಸಂರಕ್ಷಿಸಲು ಸತತ ಭಾಗಗಳ ನಡುವೆ 10 ರಿಂದ 20 ಪ್ರತಿಶತ ಅತಿಕ್ರಮಣವನ್ನು ಬಳಸುತ್ತವೆ. 0.15 ರ ಅತಿಕ್ರಮಣ ಅನುಪಾತ ಎಂದರೆ ಪ್ರತಿ ಭಾಗವು ಅದರ 15 ಪ್ರತಿಶತ ಟೋಕನ್‌ಗಳನ್ನು ಮುಂದಿನ ಭಾಗದೊಂದಿಗೆ ಹಂಚಿಕೊಳ್ಳುತ್ತದೆ, ನಿಮ್ಮ ಒಟ್ಟು ಟೋಕನ್ ಎಣಿಕೆಯನ್ನು ಅದೇ ಶೇಕಡಾವಾರು ಪ್ರಮಾಣದಲ್ಲಿ ಹೆಚ್ಚಿಸುತ್ತದೆ. ಇದು ಆಗಾಗ್ಗೆ ಕಡೆಗಣಿಸಲ್ಪಡುವ ವೆಚ್ಚ ಗುಣಕವಾಗಿದೆ.
  5. 5ಮಾದರಿ ಬೆಲೆಯಿಂದ ಒಟ್ಟು ಟೋಕನ್‌ಗಳನ್ನು (ಅತಿಕ್ರಮಣ ಸೇರಿದಂತೆ) ಗುಣಿಸುವ ಮೂಲಕ ಒಂದು ಬಾರಿ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ. ನಂತರ ಪ್ರತಿ ತಿಂಗಳು ನಿಮ್ಮ ಕಾರ್ಪಸ್‌ನ ಯಾವ ಭಾಗವು ಬದಲಾಗುತ್ತದೆ ಎಂಬುದರ ಆಧಾರದ ಮೇಲೆ ನಿಮ್ಮ ಮಾಸಿಕ ಮರು-ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವನ್ನು ಅಂದಾಜು ಮಾಡಿ. 5 ಪ್ರತಿಶತ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಮಾಸಿಕವಾಗಿ ನವೀಕರಿಸಿದರೆ, ನಿಮ್ಮ ಮರುಕಳಿಸುವ ವೆಚ್ಚವು ಆರಂಭಿಕ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚದ 5 ಪ್ರತಿಶತವಾಗಿರುತ್ತದೆ. ಸುಧಾರಿತ ಗುಣಮಟ್ಟಕ್ಕಾಗಿ ಹೊಸ ಮಾದರಿಯ ಆವೃತ್ತಿಗೆ ವಲಸೆ ಹೋಗುವಾಗ ಕೆಲವು ತಂಡಗಳು ತಮ್ಮ ಸಂಪೂರ್ಣ ಕಾರ್ಪಸ್ ಅನ್ನು ಮರು ಎಂಬೆಡ್ ಮಾಡುತ್ತವೆ.
  6. 6ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚಕ್ಕೆ ಪೂರಕವಾಗಿರುವ ವೆಕ್ಟರ್ ಶೇಖರಣಾ ವೆಚ್ಚದಲ್ಲಿನ ಅಂಶ. Pinecone ಅದರ s1 ಪಾಡ್ ಪ್ರಕಾರಕ್ಕೆ ಪ್ರತಿ ಪಾಡ್-ಗಂಟೆಗೆ $0.096 ಶುಲ್ಕ ವಿಧಿಸುತ್ತದೆ, Weaviate ಕ್ಲೌಡ್ ಸಣ್ಣ ಕ್ಲಸ್ಟರ್‌ಗಳಿಗೆ ತಿಂಗಳಿಗೆ $25 ರಿಂದ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ ಮತ್ತು ಸಾಧಾರಣ ಕ್ಲೌಡ್ VM ನಲ್ಲಿ ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಿದ pgvector ತಿಂಗಳಿಗೆ $50 ರಿಂದ $150 ವೆಚ್ಚವಾಗುತ್ತದೆ. ಎಂಬೆಡಿಂಗ್‌ಗಳ ಮಾಲೀಕತ್ವದ ಒಟ್ಟು ವೆಚ್ಚವು ಉತ್ಪಾದನೆ ಮತ್ತು ನಡೆಯುತ್ತಿರುವ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಪ್ರಶ್ನೆ ಎರಡನ್ನೂ ಒಳಗೊಂಡಿರುತ್ತದೆ.
  7. 7ಪ್ರತಿ ಡಾಕ್ಯುಮೆಂಟ್ ವೆಚ್ಚ, ಒಟ್ಟು ಒಂದು-ಬಾರಿ ವೆಚ್ಚ, ಅಂದಾಜು ಮಾಸಿಕ ಮರುಕಳಿಸುವ ವೆಚ್ಚ ಮತ್ತು ವೆಕ್ಟರ್ ಶೇಖರಣಾ ವೆಚ್ಚವನ್ನು ತೋರಿಸುವ ಅಂತಿಮ ವೆಚ್ಚದ ಸ್ಥಗಿತವನ್ನು ಪರಿಶೀಲಿಸಿ. ಮಾದರಿಗಳನ್ನು ಹೋಲಿಸಲು ಮತ್ತು ಡೇಟಾ-ಚಾಲಿತ ನಿರ್ಧಾರವನ್ನು ಮಾಡಲು ಇದನ್ನು ಬಳಸಿ. ಟೆಕ್ಸ್ಟ್-ಎಂಬೆಡಿಂಗ್-3-ಸ್ಮಾಲ್ 85 ಪ್ರತಿಶತ ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ ಟೆಕ್ಸ್ಟ್-ಎಂಬೆಡಿಂಗ್-3-ಲಾರ್ಜ್ ನ 95 ಪ್ರತಿಶತ ಅಥವಾ ಹೆಚ್ಚಿನ ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟವನ್ನು ಒದಗಿಸುತ್ತದೆ ಎಂದು ಅನೇಕ ತಂಡಗಳು ಕಂಡುಕೊಳ್ಳುತ್ತವೆ, ಇದು ಹೆಚ್ಚಿನ ಉತ್ಪಾದನಾ ಕೆಲಸದ ಹೊರೆಗಳಿಗೆ ಡೀಫಾಲ್ಟ್ ಆಯ್ಕೆಯಾಗಿದೆ.

Worked Examples

▾
Example 1ಬಜೆಟ್ ಮಾದರಿಯೊಂದಿಗೆ ಸಣ್ಣ ಜ್ಞಾನದ ಬೇಸ್
Given:50000, 300, 0.1, ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣ, 0.02
ಫಲಿತಾಂಶ:$0.33

ಅತಿಕ್ರಮಿಸುವ ಒಟ್ಟು ಟೋಕನ್‌ಗಳು 50,000 ಬಾರಿ 300 ಬಾರಿ 1.10, ಅಂದರೆ 16,500,000 ಟೋಕನ್‌ಗಳು. ಒಂದು ಮಿಲಿಯನ್‌ನಿಂದ ಭಾಗಿಸಿ $0.02 ರಿಂದ ಗುಣಿಸಿದಾಗ $0.33 ಸಿಗುತ್ತದೆ. ಆಧುನಿಕ ಬೆಲೆಯೊಂದಿಗೆ ಸಣ್ಣ ಮತ್ತು ಮಧ್ಯಮ ಕಾರ್ಪೊರಾ ಎಂಬೆಡಿಂಗ್ ಎಷ್ಟು ಕೈಗೆಟುಕುತ್ತದೆ ಎಂಬುದನ್ನು ಇದು ತೋರಿಸುತ್ತದೆ.

Example 2ಉನ್ನತ ಗುಣಮಟ್ಟದ ಮಾದರಿಯೊಂದಿಗೆ ಎಂಟರ್‌ಪ್ರೈಸ್ ಕಾರ್ಪಸ್
Given:2000000, 600, 0.2, ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ದೊಡ್ಡದು, 0.13
ಫಲಿತಾಂಶ:$187.20

20 ಪ್ರತಿಶತ ಅತಿಕ್ರಮಣದೊಂದಿಗೆ 600 ಟೋಕನ್‌ಗಳಲ್ಲಿ ಎರಡು ಮಿಲಿಯನ್ ದಾಖಲೆಗಳು ಒಟ್ಟು 1,440,000,000 ಟೋಕನ್‌ಗಳನ್ನು ನೀಡುತ್ತದೆ. ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.13, ಪೂರ್ಣ ಕಾರ್ಪಸ್‌ಗೆ $187.20 ವೆಚ್ಚವಾಗಿದೆ. ಕ್ಷುಲ್ಲಕವಲ್ಲದಿದ್ದರೂ, ಇದು ಒಂದು-ಬಾರಿ ವೆಚ್ಚವಾಗಿದ್ದು, ಉತ್ಪಾದನೆಯ ಬಳಕೆಯ ತಿಂಗಳುಗಳಲ್ಲಿ ಭೋಗ್ಯಗೊಳಿಸಬಹುದು.

Example 3ಲೆಗಸಿ ಮಾದರಿ ವಲಸೆ ವೆಚ್ಚ ಹೋಲಿಕೆ
Given:500000, 450, 0.15, $0.10/1M ನಲ್ಲಿ ada-002, $0.02/1M ನಲ್ಲಿ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣ
ಫಲಿತಾಂಶ:ಹಳೆಯದು: $25.88 ವಿರುದ್ಧ ಹೊಸದು: $5.18 (80% ಉಳಿತಾಯ)

500,000 ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳಿಗೆ ada-002 ರಿಂದ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣಗೆ ಸ್ಥಳಾಂತರಿಸುವುದು ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚದಲ್ಲಿ ಸರಿಸುಮಾರು 80 ಪ್ರತಿಶತವನ್ನು ಉಳಿಸುತ್ತದೆ. ಹೊಸ ಮಾದರಿಯು ಉತ್ತಮ ಮರುಪಡೆಯುವಿಕೆ ಮಾನದಂಡಗಳನ್ನು ಸಹ ನೀಡುತ್ತದೆ, ವಲಸೆಯನ್ನು ಅಗ್ಗದ ಮತ್ತು ಉತ್ತಮ ಗುಣಮಟ್ಟವನ್ನು ಮಾಡುತ್ತದೆ.

Example 4ಟೋಕನ್ ಹಣದುಬ್ಬರದೊಂದಿಗೆ ಬಹುಭಾಷಾ ಕಾರ್ಪಸ್
Given:300000, 700, 0.15, ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ದೊಡ್ಡದು, 0.13, ಜಪಾನೀಸ್, ಕೊರಿಯನ್, ಚೈನೀಸ್
ಫಲಿತಾಂಶ:$31.40

ಇಂಗ್ಲಿಷ್‌ಗೆ ಹೋಲಿಸಿದರೆ ಲ್ಯಾಟಿನ್ ಅಲ್ಲದ ಲಿಪಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಟೋಕನ್ ಎಣಿಕೆಗಳನ್ನು 50 ರಿಂದ 100 ಪ್ರತಿಶತದಷ್ಟು ಹೆಚ್ಚಿಸುತ್ತವೆ. ಪ್ರತಿ ಡಾಕ್ಯುಮೆಂಟ್‌ಗೆ 700 ಟೋಕನ್‌ಗಳು ಈಗಾಗಲೇ ಈ ಹಣದುಬ್ಬರಕ್ಕೆ ಕಾರಣವಾಗಿವೆ. ಒಟ್ಟು ವೆಚ್ಚವು 300,000 ಬಾರಿ 700 ಬಾರಿ 1.15 ಅನ್ನು 1,000,000 ಬಾರಿ $0.13 ರಿಂದ ಭಾಗಿಸಿ $31.40 ಆಗಿದೆ.

Real-World Applications

▾
🏗️

ಇ-ಕಾಮರ್ಸ್ ಕಂಪನಿಗಳು ನಿಖರವಾದ ಕೀವರ್ಡ್ ಹೊಂದಾಣಿಕೆಗಳ ಅಗತ್ಯಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ "ಹೈಕಿಂಗ್‌ಗಾಗಿ ಬೆಚ್ಚಗಿನ ಜಲನಿರೋಧಕ ಜಾಕೆಟ್" ನಂತಹ ನೈಸರ್ಗಿಕ ಭಾಷಾ ಪ್ರಶ್ನೆಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಶಬ್ದಾರ್ಥದ ಹುಡುಕಾಟ ವೈಶಿಷ್ಟ್ಯಗಳಿಗೆ ಶಕ್ತಿ ನೀಡಲು ಲಕ್ಷಾಂತರ ಉತ್ಪನ್ನ ವಿವರಣೆಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡುತ್ತವೆ. 200 ಟೋಕನ್‌ಗಳ ಸರಾಸರಿಯಲ್ಲಿ 5 ಮಿಲಿಯನ್ ಉತ್ಪನ್ನಗಳನ್ನು ಹೊಂದಿರುವ ಪ್ರಮುಖ ಚಿಲ್ಲರೆ ವ್ಯಾಪಾರಿಗಳು ತಮ್ಮ ಸಂಪೂರ್ಣ ಕ್ಯಾಟಲಾಗ್ ಅನ್ನು ಎಂಬೆಡ್ ಮಾಡಲು ಪಠ್ಯ-ಎಂಬೆಡ್ಡಿಂಗ್-3-ಸಣ್ಣವನ್ನು ಬಳಸಿಕೊಂಡು ಕೇವಲ $20 ಅನ್ನು ಖರ್ಚು ಮಾಡುತ್ತಾರೆ, ಇದು ಪರಿವರ್ತನೆ ದರಗಳು ಮತ್ತು ಸರಾಸರಿ ಆರ್ಡರ್ ಮೌಲ್ಯವನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಹೆಚ್ಚಿಸುವ ಹುಡುಕಾಟ ಅನುಭವಗಳನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ.

🔬

ಕಾನೂನು ತಂತ್ರಜ್ಞಾನ ಸಂಸ್ಥೆಗಳು ನೂರಾರು ಸಾವಿರ ನ್ಯಾಯಾಲಯದ ಅಭಿಪ್ರಾಯಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಕೇಸ್ ಲಾ ಡೇಟಾಬೇಸ್‌ಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡಿ ನೈಸರ್ಗಿಕ ಭಾಷಾ ಪ್ರಶ್ನೆಗಳ ಮೂಲಕ ಸಂಬಂಧಿತ ಪೂರ್ವನಿದರ್ಶನಗಳನ್ನು ಕಂಡುಹಿಡಿಯಲು ವಕೀಲರನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ. 800 ಟೋಕನ್‌ಗಳಲ್ಲಿ 500,000 ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳ ವಿಶಿಷ್ಟ ಕಾನೂನು ಕಾರ್ಪಸ್ ಪ್ರತಿ 20 ಪ್ರತಿಶತ ಅತಿಕ್ರಮಣದೊಂದಿಗೆ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣದ ಜೊತೆಗೆ ಅಂದಾಜು $9.60 ವೆಚ್ಚವಾಗುತ್ತದೆ. ಈ ಒಂದು-ಬಾರಿ ಹೂಡಿಕೆಯು ಹಸ್ತಚಾಲಿತ ಕಾನೂನು ಸಂಶೋಧನೆಯನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ, ಇದು ಹಿಂದೆ ಪ್ರತಿ ಪ್ರಕರಣಕ್ಕೆ ಗಂಟೆಗಳನ್ನು ತೆಗೆದುಕೊಂಡಿತು, ಹೂಡಿಕೆಯ ಮೇಲೆ ಅಗಾಧವಾದ ಲಾಭವನ್ನು ನೀಡುತ್ತದೆ.

📊

ಗ್ರಾಹಕ ಬೆಂಬಲ ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ಗಳು ಗ್ರಾಹಕರು ಹೊಸ ಟಿಕೆಟ್‌ಗಳನ್ನು ಸಲ್ಲಿಸಿದಾಗ ಸಂಬಂಧಿತ ಉತ್ತರಗಳನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಸೂಚಿಸಲು ಸಹಾಯ ಲೇಖನಗಳು, FAQ ನಮೂದುಗಳು ಮತ್ತು ಹಿಂದಿನ ಟಿಕೆಟ್ ನಿರ್ಣಯಗಳ ಸಂಪೂರ್ಣ ಜ್ಞಾನವನ್ನು ಎಂಬೆಡ್ ಮಾಡುತ್ತವೆ. 100,000 ಬೆಂಬಲ ಲೇಖನಗಳನ್ನು ಹೊಂದಿರುವ ಕಂಪನಿಯು ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣದೊಂದಿಗೆ $1 ಅಡಿಯಲ್ಲಿ ಅವುಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡಬಹುದು, ನಂತರ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಪರಿಹಾರಗಳ ವಿರುದ್ಧ ಒಳಬರುವ ಪ್ರಶ್ನೆಗಳನ್ನು ಹೊಂದಿಸಲು ಕೊಸೈನ್ ಹೋಲಿಕೆಯನ್ನು ಬಳಸಿ. ಇದು ಸಾಮಾನ್ಯವಾಗಿ 40 ರಿಂದ 60 ಪ್ರತಿಶತ ಟಿಕೆಟ್‌ಗಳನ್ನು ಮಾನವ ಏಜೆಂಟ್ ಅನ್ನು ತಲುಪುವ ಮೊದಲು ತಿರುಗಿಸುತ್ತದೆ.

🏥

ಹೆಲ್ತ್‌ಕೇರ್ ತಂತ್ರಜ್ಞಾನ ಕಂಪನಿಗಳು ವೈದ್ಯಕೀಯ ಸಾಹಿತ್ಯ ಮತ್ತು ಕ್ಲಿನಿಕಲ್ ಮಾರ್ಗಸೂಚಿಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡುತ್ತವೆ, ಇದು ವೈದ್ಯಕೀಯ ಪ್ರಶ್ನೆಗಳಿಗೆ ಪುರಾವೆ ಆಧಾರಿತ ಉತ್ತರಗಳನ್ನು ತ್ವರಿತವಾಗಿ ಕಂಡುಹಿಡಿಯಲು ವೈದ್ಯರಿಗೆ ಸಹಾಯ ಮಾಡುವ ಮರುಪಡೆಯುವಿಕೆ-ವರ್ಧಿತ ಪೀಳಿಗೆಯ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. 400 ಟೋಕನ್‌ಗಳಲ್ಲಿ 2 ಮಿಲಿಯನ್ ಸಂಶೋಧನಾ ಸಾರಾಂಶಗಳ ಡೇಟಾಬೇಸ್ ಪ್ರತಿಯೊಂದೂ ಎಂಬೆಡ್ ಮಾಡಲು ಸುಮಾರು $16 ವೆಚ್ಚವಾಗುತ್ತದೆ. ವೆಕ್ಟರ್ ಪ್ರಾತಿನಿಧ್ಯಗಳು ವೈದ್ಯಕೀಯ ಸಮಾನಾರ್ಥಕ ಪದಗಳು ಮತ್ತು ಸಂಬಂಧಿತ ಪರಿಕಲ್ಪನೆಗಳನ್ನು ಸಾಂಪ್ರದಾಯಿಕ ಕೀವರ್ಡ್ ಹುಡುಕಾಟಕ್ಕೆ ಸಾಧ್ಯವಾಗದ ರೀತಿಯಲ್ಲಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಶಬ್ದಾರ್ಥದ ಹೊಂದಾಣಿಕೆಯನ್ನು ಸಕ್ರಿಯಗೊಳಿಸುತ್ತದೆ.

Special Cases

▾

ಉತ್ಪನ್ನ ಶೀರ್ಷಿಕೆಗಳು ಅಥವಾ ಹುಡುಕಾಟ ಪ್ರಶ್ನೆಗಳಂತಹ ಚಿಕ್ಕ ಪಠ್ಯಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡುವಾಗ

ಕೇವಲ 5 ರಿಂದ 20 ಟೋಕನ್‌ಗಳ ಉದ್ದವಿರುವ ಉತ್ಪನ್ನ ಶೀರ್ಷಿಕೆಗಳು ಅಥವಾ ಹುಡುಕಾಟ ಪ್ರಶ್ನೆಗಳಂತಹ ಅತ್ಯಂತ ಚಿಕ್ಕ ಪಠ್ಯಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡುವಾಗ, ಪ್ರತಿ ಡಾಕ್ಯುಮೆಂಟ್‌ನ ವೆಚ್ಚವು ಅತ್ಯಲ್ಪವಾಗುತ್ತದೆ (ಪ್ರತಿಯೊಂದು $0.0000004 ಕ್ಕಿಂತ ಕಡಿಮೆ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣ), ಆದರೆ ಒಟ್ಟು API ಕರೆ ಓವರ್‌ಹೆಡ್ ಅಡಚಣೆಯಾಗಬಹುದು. OpenAI ಎಂಬೆಡಿಂಗ್ ಎಂಡ್‌ಪಾಯಿಂಟ್‌ಗಳು ಪ್ರತಿ ವಿನಂತಿಗೆ 2048 ಪಠ್ಯಗಳ ಬ್ಯಾಚ್‌ಗಳನ್ನು ಸ್ವೀಕರಿಸುತ್ತವೆ ಮತ್ತು ಸಣ್ಣ ಪಠ್ಯಗಳನ್ನು ಒಟ್ಟಿಗೆ ಬ್ಯಾಚ್ ಮಾಡುವುದರಿಂದ ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ನೂರಾರು ರಿಂದ ಹತ್ತು ಸಾವಿರ ಎಂಬೆಡಿಂಗ್‌ಗಳ ಥ್ರೋಪುಟ್ ಅನ್ನು ನಾಟಕೀಯವಾಗಿ ಸುಧಾರಿಸುತ್ತದೆ. ಪ್ರತ್ಯೇಕ API ಕರೆಗಳನ್ನು ಕಳುಹಿಸುವ ಬದಲು ಯಾವಾಗಲೂ ಚಿಕ್ಕ ಪಠ್ಯಗಳನ್ನು ಬ್ಯಾಚ್ ಮಾಡಿ.

100 ಮಿಲಿಯನ್ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಮೀರಿದ ಕಾರ್ಪೋರಾಗಳಿಗೆ, ವೆಚ್ಚದ ಲೆಕ್ಕಾಚಾರವನ್ನು ಗಣನೆಗೆ ತೆಗೆದುಕೊಳ್ಳಬೇಕು

100 ಮಿಲಿಯನ್ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಮೀರಿದ ಕಾರ್ಪೋರಾಗಳಿಗೆ, ವೆಚ್ಚದ ಲೆಕ್ಕಾಚಾರವು API ದರ ಮಿತಿಗಳು ಮತ್ತು ಸಮಯದ ಆಯಾಮವನ್ನು ಗಣನೆಗೆ ತೆಗೆದುಕೊಳ್ಳಬೇಕು. OpenAI ಎಂಬೆಡಿಂಗ್ ಎಂಡ್‌ಪಾಯಿಂಟ್‌ಗಳು ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ ಟೋಕನ್‌ಗಳಲ್ಲಿ ಅಳೆಯುವ ದರ ಮಿತಿಗಳನ್ನು ಹೊಂದಿವೆ ಮತ್ತು ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ 5 ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳ ದರ ಮಿತಿಯಲ್ಲಿ 100 ಮಿಲಿಯನ್ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು 500 ಟೋಕನ್‌ಗಳಲ್ಲಿ (50 ಬಿಲಿಯನ್ ಟೋಕನ್‌ಗಳು) ಎಂಬೆಡ್ ಮಾಡುವುದು ಸುಮಾರು 7 ದಿನಗಳ ನಿರಂತರ ಪ್ರಕ್ರಿಯೆಗೆ ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ. ಈ ಪ್ರಮಾಣದಲ್ಲಿ, ಬಹು GPU ಗಳಲ್ಲಿ ಮುಕ್ತ-ಮೂಲ ಮಾದರಿಯನ್ನು ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡುವುದು ವಿಶಿಷ್ಟವಾಗಿ ಹೆಚ್ಚು ಪ್ರಾಯೋಗಿಕ ಮತ್ತು ವೆಚ್ಚ-ಪರಿಣಾಮಕಾರಿಯಾಗಿದೆ, ಮೂಲಸೌಕರ್ಯ ಸಂಕೀರ್ಣತೆಗೆ ಸಹ ಲೆಕ್ಕ ಹಾಕುತ್ತದೆ.

ಬಹುಭಾಷಾ ಎಂಬೆಡಿಂಗ್ ಸಿಸ್ಟಮ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುವಾಗ, ಟೋಕನ್ ಎಣಿಕೆಗಳು ಭಾಷೆಗಳಾದ್ಯಂತ ಗಮನಾರ್ಹವಾಗಿ ಬದಲಾಗುತ್ತವೆ ಎಂಬುದನ್ನು ತಿಳಿದಿರಲಿ.

ಇಂಗ್ಲಿಷ್‌ನಲ್ಲಿ 100-ಪದಗಳ ಅಂಗೀಕಾರವು 130 ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸಬಹುದು, ಆದರೆ ಜಪಾನೀಸ್‌ನಲ್ಲಿ ವ್ಯಕ್ತಪಡಿಸಿದ ಅದೇ ಅರ್ಥವು ಅಕ್ಷರ-ಮಟ್ಟದ ಟೋಕನೈಸೇಶನ್‌ನಿಂದಾಗಿ 200 ರಿಂದ 250 ಟೋಕನ್‌ಗಳ ಅಗತ್ಯವಿರುತ್ತದೆ. ಇದರರ್ಥ ಜಪಾನೀಸ್, ಚೈನೀಸ್, ಕೊರಿಯನ್, ಥಾಯ್ ಮತ್ತು ಅರೇಬಿಕ್ ಕಾರ್ಪೋರಾಗಳಿಗೆ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚಗಳು ಸಮಾನವಾದ ಇಂಗ್ಲಿಷ್ ಕಾರ್ಪೋರಾಕ್ಕಿಂತ 50 ರಿಂದ 100 ಪ್ರತಿಶತ ಹೆಚ್ಚಿರಬಹುದು. ಅದಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಬಜೆಟ್ ಮಾಡಿ ಮತ್ತು ನಿಮ್ಮ ಗುರಿ ಭಾಷೆಗಳಿಗೆ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಟೋಕನೈಸ್ ಮಾಡಬಹುದಾದ ಭಾಷೆ-ನಿರ್ದಿಷ್ಟ ಎಂಬೆಡಿಂಗ್ ಮಾದರಿಗಳನ್ನು ಪರಿಗಣಿಸಿ.

ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್ ಬೆಲೆ ಹೋಲಿಕೆ (2025)

▾
ಮಾದರಿಒದಗಿಸುವವರುಪ್ರತಿ 1M ಟೋಕನ್‌ಗಳಿಗೆ ಬೆಲೆಡೀಫಾಲ್ಟ್ ಆಯಾಮಗಳುಗರಿಷ್ಠ ಟೋಕನ್ಗಳುMTEB ಸ್ಕೋರ್
ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣOpenAI$0.021536819162.3%
ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ದೊಡ್ಡದುOpenAI$0.133072819164.6%
ಪಠ್ಯ ಎಂಬೆಡಿಂಗ್-ಅಡಾ-002OpenAI$0.101536819161.0%
ಎಂಬೆಡ್-ವಿ3 (ಇಂಗ್ಲಿಷ್)ಕೊಹೆರ್$0.10102451264.5%
ಜೆಮಿನಿ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-004ಗೂಗಲ್$0.00625768204866.3%
BGE-large-en-v1.5ತೆರೆದ ಮೂಲಸ್ವಯಂ ಹೋಸ್ಟ್102451263.6%
E5-ದೊಡ್ಡದು-v2ತೆರೆದ ಮೂಲಸ್ವಯಂ ಹೋಸ್ಟ್102451262.7%

Frequently Asked Questions

▾
Q

ಯಾವ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್ ಅತ್ಯುತ್ತಮ ವೆಚ್ಚ-ಗುಣಮಟ್ಟದ ಅನುಪಾತವನ್ನು ನೀಡುತ್ತದೆ?

A

ಹೆಚ್ಚಿನ ಉತ್ಪಾದನಾ ಬಳಕೆಯ ಸಂದರ್ಭಗಳಲ್ಲಿ, OpenAI ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣ ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.02 ರಂತೆ ಗುಣಮಟ್ಟ ಮತ್ತು ವೆಚ್ಚದ ಅತ್ಯುತ್ತಮ ಸಮತೋಲನವನ್ನು ನೀಡುತ್ತದೆ. ಇದು MTEB ಯಂತಹ ಪ್ರಮಾಣಿತ ಮರುಪಡೆಯುವಿಕೆ ಮಾನದಂಡಗಳಲ್ಲಿ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ದೊಡ್ಡದ 2 ರಿಂದ 5 ಶೇಕಡಾವಾರು ಪಾಯಿಂಟ್‌ಗಳ ಒಳಗೆ ಸ್ಕೋರ್ ಮಾಡುತ್ತದೆ ಆದರೆ 85 ಪ್ರತಿಶತ ಕಡಿಮೆ ವೆಚ್ಚವಾಗುತ್ತದೆ. ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಿಗೆ $0.13 ರಂತೆ ದೊಡ್ಡ ಮಾದರಿಯು ಹೆಚ್ಚು ವಿಶೇಷವಾದ ಡೊಮೇನ್‌ಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುವಾಗ ಮಾತ್ರ ಪ್ರೀಮಿಯಂಗೆ ಯೋಗ್ಯವಾಗಿರುತ್ತದೆ, ಅಲ್ಲಿ ಪ್ರತಿ ಶೇಕಡಾವಾರು ಹಿಂಪಡೆಯುವಿಕೆಯ ನಿಖರತೆ ಮುಖ್ಯವಾಗಿರುತ್ತದೆ, ಉದಾಹರಣೆಗೆ ಕಾನೂನು ಅಥವಾ ವೈದ್ಯಕೀಯ ಹುಡುಕಾಟ.

Q

ಸಾಮಾನ್ಯ ಡಾಕ್ಯುಮೆಂಟ್ ಎಷ್ಟು ಟೋಕನ್‌ಗಳನ್ನು ಒಳಗೊಂಡಿದೆ?

A

ಪ್ರಮಾಣಿತ 500-ಪದಗಳ ಇಂಗ್ಲಿಷ್ ಡಾಕ್ಯುಮೆಂಟ್ BPE ಟೋಕನೈಸೇಶನ್ ಬಳಸಿಕೊಂಡು ಸರಿಸುಮಾರು 625 ರಿಂದ 700 ಟೋಕನ್‌ಗಳನ್ನು ಒಳಗೊಂಡಿದೆ. RAG ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗಾಗಿ, ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಸಾಮಾನ್ಯವಾಗಿ 50 ರಿಂದ 128 ಟೋಕನ್ ಅತಿಕ್ರಮಣದೊಂದಿಗೆ 256 ರಿಂದ 512 ಟೋಕನ್ ವಿಭಾಗಗಳಾಗಿ ವಿಂಗಡಿಸಲಾಗುತ್ತದೆ. ಒಂದು ಟೋಕನ್ ಸರಿಸುಮಾರು ನಾಲ್ಕು ಇಂಗ್ಲಿಷ್ ಅಕ್ಷರಗಳು ಅಥವಾ 0.75 ಪದಗಳು. ಚೈನೀಸ್, ಜಪಾನೀಸ್ ಮತ್ತು ಕೊರಿಯನ್ ನಂತಹ ಲ್ಯಾಟಿನ್ ಅಲ್ಲದ ಸ್ಕ್ರಿಪ್ಟ್‌ಗಳು ಬೈಟ್-ಜೋಡಿ ಎನ್‌ಕೋಡಿಂಗ್ ತಮ್ಮ ಅಕ್ಷರ ಸೆಟ್‌ಗಳನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬ ಕಾರಣದಿಂದಾಗಿ ಪ್ರತಿ ಪದಕ್ಕೆ 1.5 ರಿಂದ 2 ಪಟ್ಟು ಹೆಚ್ಚು ಟೋಕನ್‌ಗಳನ್ನು ಬಳಸಬಹುದು.

Q

ನಾನು ಸಣ್ಣ ಅಥವಾ ದೊಡ್ಡ ಎಂಬೆಡಿಂಗ್ ಮಾದರಿಯನ್ನು ಬಳಸಬೇಕೇ?

A

ಅಭಿವೃದ್ಧಿ ಮತ್ತು ಆರಂಭಿಕ ಉತ್ಪಾದನೆಯ ನಿಯೋಜನೆಗಾಗಿ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣದೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ. ನಿಮ್ಮ ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟದ ಮೆಟ್ರಿಕ್‌ಗಳನ್ನು ಅಳೆಯಿರಿ ಉದಾಹರಣೆಗೆ k ನಲ್ಲಿ ಮರುಪಡೆಯುವಿಕೆ ಮತ್ತು ನಿಮ್ಮ ನಿರ್ದಿಷ್ಟ ಡೇಟಾದಲ್ಲಿ ಪರಸ್ಪರ ಶ್ರೇಣಿಯ ಸರಾಸರಿ. ಈ ಮೆಟ್ರಿಕ್‌ಗಳು ನಿಮ್ಮ ಗುಣಮಟ್ಟದ ಮಿತಿಗಿಂತ ಕೆಳಗಿದ್ದರೆ, ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಲಾರ್ಜ್‌ಗೆ ಅಪ್‌ಗ್ರೇಡ್ ಮಾಡಿ ಮತ್ತು ಹೋಲಿಕೆ ಮಾಡಿ. ಪ್ರಾಯೋಗಿಕವಾಗಿ, 20 ಪ್ರತಿಶತಕ್ಕಿಂತ ಕಡಿಮೆ ತಂಡಗಳು ದೊಡ್ಡ ಮಾದರಿಯಿಂದ ಗುಣಮಟ್ಟದ ಸುಧಾರಣೆಯನ್ನು 6.5 ಪಟ್ಟು ಹೆಚ್ಚಿನ ವೆಚ್ಚವನ್ನು ಸಮರ್ಥಿಸುತ್ತದೆ.

Q

ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಶೇಖರಣಾ ವೆಚ್ಚಕ್ಕೆ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವು ಹೇಗೆ ಹೋಲಿಸುತ್ತದೆ?

A

ಎಂಬೆಡಿಂಗ್ ಉತ್ಪಾದನೆಯು ಸಾಮಾನ್ಯವಾಗಿ ಒಂದು ಬಾರಿ ಅಥವಾ ಅಪರೂಪದ ವೆಚ್ಚವಾಗಿದೆ, ಆದರೆ ವೆಕ್ಟರ್ ಸಂಗ್ರಹಣೆಯು ನಡೆಯುತ್ತಿರುವ ಮಾಸಿಕ ವೆಚ್ಚವಾಗಿದೆ. ಒಂದು ಮಿಲಿಯನ್ 1536-ಆಯಾಮದ ವೆಕ್ಟರ್‌ಗಳಿಗೆ, ಕಚ್ಚಾ ಸಂಗ್ರಹಣೆಯು ಸುಮಾರು 6 GB ಆಗಿದೆ. Pinecone ನಲ್ಲಿ, ಇದು ನಿಮ್ಮ ಪಾಡ್ ಕಾನ್ಫಿಗರೇಶನ್‌ಗೆ ಅನುಗುಣವಾಗಿ ತಿಂಗಳಿಗೆ $70 ರಿಂದ $100 ವೆಚ್ಚವಾಗಬಹುದು. ಅದೇ ಮಿಲಿಯನ್ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳಿಗೆ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣದೊಂದಿಗಿನ ಆರಂಭಿಕ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವು ಸುಮಾರು $10 ರಿಂದ $15 ಆಗಿರುತ್ತದೆ, ಒಂದು-ಬಾರಿ ಶುಲ್ಕ. ಒಂದು ವರ್ಷದಲ್ಲಿ, ವೆಕ್ಟರ್ ಶೇಖರಣಾ ವೆಚ್ಚವು ಸಾಮಾನ್ಯವಾಗಿ ಎಂಬೆಡಿಂಗ್ ಉತ್ಪಾದನೆಯ ವೆಚ್ಚವನ್ನು 5 ರಿಂದ 10 ಪಟ್ಟು ಮೀರುತ್ತದೆ.

Q

ವೆಕ್ಟರ್ ಆಯಾಮಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ ನಾನು ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದೇ?

A

ಹೌದು, ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣ ಮತ್ತು ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ದೊಡ್ಡ ಎರಡೂ ಬೆಂಬಲ Matryoshka ಆಯಾಮ ಕಡಿತ, ನೀವು ಮರು ಎಂಬೆಡಿಂಗ್ ಇಲ್ಲದೆ ಕಡಿಮೆ ಆಯಾಮಗಳಿಗೆ ವೆಕ್ಟರ್ ಮೊಟಕುಗೊಳಿಸಲು ಅನುಮತಿಸುತ್ತದೆ. 1536 ರಿಂದ 256 ಆಯಾಮಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುವುದರಿಂದ ಸಂಗ್ರಹಣೆ ಮತ್ತು ಹುಡುಕಾಟ ವೆಚ್ಚವನ್ನು ಸುಮಾರು 83 ಪ್ರತಿಶತದಷ್ಟು ಕಡಿತಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟದಲ್ಲಿ ಸಾಧಾರಣ ಇಳಿಕೆಯಾಗಿದೆ. ಸಂಗ್ರಹಣೆ ಮತ್ತು ಹುಡುಕಾಟ ಲೇಟೆನ್ಸಿ ವೆಚ್ಚಗಳು ಮಾಲೀಕತ್ವದ ಒಟ್ಟು ವೆಚ್ಚದಲ್ಲಿ ಪ್ರಾಬಲ್ಯ ಹೊಂದಿರುವ ದೊಡ್ಡ-ಪ್ರಮಾಣದ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗೆ ಈ ತಂತ್ರವು ವಿಶೇಷವಾಗಿ ಉಪಯುಕ್ತವಾಗಿದೆ.

Q

ಮುಕ್ತ-ಮೂಲ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್‌ಗಳನ್ನು ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡುವುದು ಅಗ್ಗವಾಗಿದೆಯೇ?

A

ಕ್ಲೌಡ್ GPU ನಲ್ಲಿ BGE-ಲಾರ್ಜ್ ಅಥವಾ E5-large-v2 ನಂತಹ ಸ್ವಯಂ-ಹೋಸ್ಟಿಂಗ್ ಮಾಡೆಲ್‌ಗಳು ಪ್ರಮಾಣದಲ್ಲಿ ವೆಚ್ಚ-ಪರಿಣಾಮಕಾರಿಯಾಗುತ್ತವೆ. ಪ್ರತಿ ಗಂಟೆಗೆ ಸರಿಸುಮಾರು $1 ದರದಲ್ಲಿ ಒಂದು A10G GPU ನಿದರ್ಶನವು ಪ್ರತಿ ಸೆಕೆಂಡಿಗೆ ಸರಿಸುಮಾರು 1,000 ರಿಂದ 2,000 ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡಬಹುದು. 10 ಮಿಲಿಯನ್ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳಲ್ಲಿ, ಸ್ವಯಂ-ಹೋಸ್ಟಿಂಗ್ ವೆಚ್ಚವು ಕಂಪ್ಯೂಟ್ ಸಮಯದಲ್ಲಿ $5 ರಿಂದ $10 ಮತ್ತು API ಮೂಲಕ $2 ರಿಂದ $13. ಆದಾಗ್ಯೂ, ನೀವು ಮೂಲಸೌಕರ್ಯ ನಿರ್ವಹಣೆ, ಮೇಲ್ವಿಚಾರಣೆ ಮತ್ತು ಸ್ಕೇಲಿಂಗ್ ವೆಚ್ಚಗಳನ್ನು ಸಹ ಭರಿಸುತ್ತೀರಿ. ಬ್ರೇಕ್-ಈವ್ ಪಾಯಿಂಟ್ ಸಾಮಾನ್ಯವಾಗಿ ನಡೆಯುತ್ತಿರುವ ಕೆಲಸದ ಹೊರೆಗಳಿಗಾಗಿ ತಿಂಗಳಿಗೆ ಸುಮಾರು 50 ರಿಂದ 100 ಮಿಲಿಯನ್ ಟೋಕನ್‌ಗಳಾಗಿರುತ್ತದೆ.

Q

ನನ್ನ ದಾಖಲೆಗಳನ್ನು ನಾನು ಎಷ್ಟು ಬಾರಿ ಮರು ಎಂಬೆಡ್ ಮಾಡಬೇಕು?

A

ವಿಷಯವು ಭೌತಿಕವಾಗಿ ಬದಲಾದಾಗ ಅಥವಾ ನೀವು ಹೊಸ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್‌ಗೆ ವಲಸೆ ಹೋದಾಗ ಮಾತ್ರ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಮರು ಎಂಬೆಡ್ ಮಾಡಿ. ವಿಷಯ ನವೀಕರಣಗಳಿಗಾಗಿ, ಸಂಪೂರ್ಣ ಕಾರ್ಪಸ್ ಬದಲಿಗೆ ಬದಲಾದ ದಾಖಲೆಗಳನ್ನು ಮಾತ್ರ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವ ಹೆಚ್ಚುತ್ತಿರುವ ಮರು-ಎಂಬೆಡಿಂಗ್ ಅನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸಿ. ಹೊಸ ಮಾದರಿಯ ಆವೃತ್ತಿಗೆ ಅಪ್‌ಗ್ರೇಡ್ ಮಾಡುವಾಗ ಹೆಚ್ಚಿನ ತಂಡಗಳು ವರ್ಷಕ್ಕೆ ಒಂದು ಅಥವಾ ಎರಡು ಬಾರಿ ತಮ್ಮ ಪೂರ್ಣ ಕಾರ್ಪಸ್ ಅನ್ನು ಮರು-ಎಂಬೆಡ್ ಮಾಡುತ್ತವೆ. ಮರು-ಎಂಬೆಡ್ ಮಾಡಲು ಮಾರ್ಪಡಿಸಿದ ಡಾಕ್ಯುಮೆಂಟ್‌ಗಳನ್ನು ಫ್ಲ್ಯಾಗ್ ಮಾಡುವ ಬದಲಾವಣೆ ಪತ್ತೆ ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ಹೊಂದಿಸುವುದು ನಿಮ್ಮ ನಿಜವಾದ ವಿಷಯ ಮಂಥನ ದರಕ್ಕೆ ಅನುಪಾತದಲ್ಲಿರುತ್ತದೆ.

Common Mistakes to Avoid

▾
  • !LLM ಇನ್ಫರೆನ್ಸ್ ಬೆಲೆಯೊಂದಿಗೆ ಎಂಬೆಡಿಂಗ್ ಬೆಲೆಯನ್ನು ಗೊಂದಲಗೊಳಿಸುವುದು:
  • !ಚಂಕಿಂಗ್ ಓವರ್‌ಲ್ಯಾಪ್ ಟೋಕನ್ ಓವರ್‌ಹೆಡ್ ಅನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗುತ್ತಿದೆ:
  • !ಮಾದರಿಗಳನ್ನು ನವೀಕರಿಸಿದಾಗ ಮರು-ಎಂಬೆಡ್ ಮಾಡುವ ವೆಚ್ಚವನ್ನು ಮರೆತುಬಿಡುವುದು:
💡

Pro Tip

ಮೂಲಮಾದರಿಗಾಗಿ 256 ಆಯಾಮಗಳಿಗೆ Matryoshka ಆಯಾಮ ಕಡಿತದೊಂದಿಗೆ ಪಠ್ಯ ಎಂಬೆಡಿಂಗ್-3-ಚಿಕ್ಕದನ್ನು ಬಳಸಿ. ಇದು ನಿಮಗೆ ಡೀಫಾಲ್ಟ್ 1536 ಆಯಾಮಗಳಿಗಿಂತ 6 ಪಟ್ಟು ಚಿಕ್ಕದಾಗಿರುವ ವೆಕ್ಟರ್‌ಗಳನ್ನು ನೀಡುತ್ತದೆ, ಸುಮಾರು 90 ಪ್ರತಿಶತ ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟವನ್ನು ಉಳಿಸಿಕೊಂಡು ಸಂಗ್ರಹಣೆ ಮತ್ತು ಹುಡುಕಾಟ ವೆಚ್ಚಗಳನ್ನು ತೀವ್ರವಾಗಿ ಕಡಿತಗೊಳಿಸುತ್ತದೆ. ನಿಮ್ಮ ಮೌಲ್ಯಮಾಪನ ಮೆಟ್ರಿಕ್‌ಗಳು ಬೇಡಿಕೆಯಿದ್ದರೆ ಉತ್ಪಾದನೆಗಾಗಿ ನೀವು ಯಾವಾಗಲೂ ಪೂರ್ಣ ಆಯಾಮದಲ್ಲಿ ಮರು-ಎಂಬೆಡ್ ಮಾಡಬಹುದು.

⭐

Did you know?

ಸರಿಸುಮಾರು 4.4 ಶತಕೋಟಿ ಟೋಕನ್‌ಗಳೊಂದಿಗೆ ಸರಿಸುಮಾರು 6.7 ಮಿಲಿಯನ್ ಲೇಖನಗಳನ್ನು ಒಳಗೊಂಡಿರುವ ಸಂಪೂರ್ಣ ಇಂಗ್ಲಿಷ್ ವಿಕಿಪೀಡಿಯಾವನ್ನು ಸುಮಾರು $88 ಕ್ಕೆ ಪಠ್ಯ-ಎಂಬೆಡಿಂಗ್-3-ಸಣ್ಣ ಬಳಸಿ ಸಂಪೂರ್ಣವಾಗಿ ಎಂಬೆಡ್ ಮಾಡಬಹುದು. ಇದರರ್ಥ ವಿಕಿಪೀಡಿಯಾದಲ್ಲಿ ಸಂಗ್ರಹಿಸಲಾದ ಎಲ್ಲಾ ಮಾನವ ಜ್ಞಾನದ ಮೇಲೆ ಸಂಪೂರ್ಣ ಶಬ್ದಾರ್ಥದ ಹುಡುಕಾಟ ಎಂಜಿನ್ ಅನ್ನು ರಚಿಸುವುದು ಮಧ್ಯಮ ಶ್ರೇಣಿಯ ರೆಸ್ಟೋರೆಂಟ್‌ನಲ್ಲಿ ಒಂದು ಭೋಜನಕ್ಕಿಂತ ಕಡಿಮೆ ವೆಚ್ಚವಾಗುತ್ತದೆ.

Regional Guides

▾
North America▾
ಡೇಟಾ ರೆಸಿಡೆನ್ಸಿ ಪ್ರಾಶಸ್ತ್ಯಗಳು ಮತ್ತು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಎಂಟರ್‌ಪ್ರೈಸ್ ಒಪ್ಪಂದಗಳ ಕಾರಣದಿಂದಾಗಿ ಉತ್ತರ ಅಮೆರಿಕಾದ ಕಂಪನಿಗಳು ಸಾಮಾನ್ಯವಾಗಿ OpenAI ಅಥವಾ Cohere ಎಂಬೆಡಿಂಗ್ API ಗಳನ್ನು ಬಳಸುತ್ತವೆ. ಅನೇಕ ಫಾರ್ಚೂನ್ 500 ಕಂಪನಿಗಳು ತಿಂಗಳಿಗೆ 10 ಬಿಲಿಯನ್ ಟೋಕನ್‌ಗಳನ್ನು ಮೀರಿದ ಕೆಲಸದ ಹೊರೆಗಳನ್ನು ಎಂಬೆಡಿಂಗ್ ಮಾಡಲು OpenAI ನೊಂದಿಗೆ ನೇರವಾಗಿ ಪರಿಮಾಣದ ರಿಯಾಯಿತಿಗಳನ್ನು ಮಾತುಕತೆ ನಡೆಸುತ್ತವೆ. ದೊಡ್ಡದಾದ AWS ಮತ್ತು GCP ಪ್ರದೇಶದ ಲಭ್ಯತೆಯಿಂದಾಗಿ ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಲಾದ ಮಾದರಿಗಳಿಗಾಗಿ US-ಆಧಾರಿತ ಕ್ಲೌಡ್ ಮೂಲಸೌಕರ್ಯವು ಸಾಮಾನ್ಯವಾಗಿ ಯುರೋಪಿಯನ್ ಸಮಾನತೆಗಳಿಗಿಂತ 10 ರಿಂದ 20 ಪ್ರತಿಶತ ಕಡಿಮೆ ವೆಚ್ಚವಾಗುತ್ತದೆ.
Europe▾
ಎಂಬೆಡಿಂಗ್ ಪೂರೈಕೆದಾರರನ್ನು ಆಯ್ಕೆಮಾಡುವಾಗ ಯುರೋಪಿಯನ್ ಸಂಸ್ಥೆಗಳು GDPR ಅನುಸರಣೆಯನ್ನು ಪರಿಗಣಿಸಬೇಕು. OpenAI ನಂತಹ US-ಆಧಾರಿತ API ಗಳಿಗೆ ವೈಯಕ್ತಿಕ ಡೇಟಾವನ್ನು ಕಳುಹಿಸಲು ನಿರ್ದಿಷ್ಟ ಡೇಟಾ ಸಂಸ್ಕರಣಾ ಒಪ್ಪಂದಗಳು ಮತ್ತು ಸಮರ್ಪಕ ನಿರ್ಧಾರಗಳ ಅಗತ್ಯವಿರಬಹುದು. ಅನೇಕ ಯುರೋಪಿಯನ್ ಕಂಪನಿಗಳು ಡೇಟಾ ಸಾರ್ವಭೌಮತ್ವವನ್ನು ನಿರ್ವಹಿಸಲು EU-ಪ್ರದೇಶದ ಕ್ಲೌಡ್ ಮೂಲಸೌಕರ್ಯದಲ್ಲಿ ಚಾಲನೆಯಲ್ಲಿರುವ ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಿದ ಮುಕ್ತ-ಮೂಲ ಮಾದರಿಗಳನ್ನು ಆರಿಸಿಕೊಳ್ಳುತ್ತವೆ. EU ಡೇಟಾ ರೆಸಿಡೆನ್ಸಿಯೊಂದಿಗೆ Azure OpenAI ಸೇವೆಯು ಜನಪ್ರಿಯ ಮಧ್ಯಮ ನೆಲವಾಗಿದೆ, ಆದರೂ ಬೆಲೆಯು ನೇರ OpenAI API ಗೆ ಹೋಲುತ್ತದೆ.
Asia-Pacific▾
ಏಷ್ಯಾ-ಪೆಸಿಫಿಕ್ ಪ್ರದೇಶದಲ್ಲಿ, ಬಹುಭಾಷಾ ಎಂಬೆಡಿಂಗ್ ಅಗತ್ಯತೆಗಳು ಸಾಮಾನ್ಯವಾಗಿದೆ ಮತ್ತು CJK (ಚೀನೀ, ಜಪಾನೀಸ್, ಕೊರಿಯನ್) ಭಾಷೆಗಳ ಗುಣಲಕ್ಷಣ-ಭಾರೀ ಸ್ವಭಾವದಿಂದಾಗಿ ಟೋಕನ್ ವೆಚ್ಚಗಳು ಹೆಚ್ಚಿರುತ್ತವೆ. Baidu ERNIE ಎಂಬೆಡಿಂಗ್‌ಗಳು ಮತ್ತು Alibaba Cloud DashScope ನಂತಹ ಸ್ಥಳೀಯ ಪರ್ಯಾಯಗಳು ಚೀನೀ ಭಾಷೆಯ ಕೆಲಸದ ಹೊರೆಗಳಿಗೆ ಸ್ಪರ್ಧಾತ್ಮಕ ಬೆಲೆಯನ್ನು ನೀಡುತ್ತವೆ. ಜಪಾನ್ ಮತ್ತು ಕೊರಿಯಾದಲ್ಲಿನ ಕಂಪನಿಗಳು ಗಡಿಯಾಚೆಗಿನ ಡೇಟಾ ವರ್ಗಾವಣೆ ಸಮಸ್ಯೆಗಳನ್ನು ತಪ್ಪಿಸಲು ಮತ್ತು ಸ್ಥಳೀಯ ಬಳಕೆದಾರರಿಗೆ ಸುಪ್ತತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಬಹುಭಾಷಾ-e5-ದೊಡ್ಡ ಅಥವಾ ಅಂತಹುದೇ ಮಾದರಿಗಳನ್ನು ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡುತ್ತವೆ.
📖Difficulty:Intermediate
Accuracy-checked
Reviewed October 2026
Our methodology

ಸಾಪ್ತಾಹಿಕ ಗಣಿತ ಸಲಹೆಗಳನ್ನು ಪಡೆಯಿರಿ

ಪ್ರತಿ ವಾರ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಸಲಹೆಗಳನ್ನು ಪಡೆಯುವ 12,000+ ಚಂದಾದಾರರನ್ನು ಸೇರಿ.

🔒
ಉಚಿತ
ಯಾವಾಗಲೂ ಉಚಿತ, ಯಾವುದೇ ನೋಂದಣಿ ಇಲ್ಲ
✓
ನಿಖರ
ಪರಿಶೀಲಿಸಿದ ಸೂತ್ರಗಳು ಮತ್ತು ಲೆಕ್ಕಾಚಾರಗಳು
⚡
ತ್ವರಿತ
ತಕ್ಷಣ ಫಲಿತಾಂಶಗಳು, ಯಾವುದೇ ವಿಳಂಬ ಇಲ್ಲ
📱
ಮೊಬೈಲ್
ಎಲ್ಲಾ ಸಾಧನಗಳಲ್ಲಿ ಕಾರ್ಯ ನಿರ್ವಹಿಸುತ್ತದೆ

ಸೆಟ್ಟಿಂಗ್‌ಗಳು