What is RAG Pipeline Cost Calculator?
▾
RAG ಪೈಪ್ಲೈನ್ ವೆಚ್ಚ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ನಾಲ್ಕು ವೆಚ್ಚದ ಘಟಕಗಳನ್ನು ಸಂಯೋಜಿಸುವ ಮೂಲಕ ಮರುಪಡೆಯುವಿಕೆ-ವರ್ಧಿತ ಜನರೇಷನ್ ಸಿಸ್ಟಮ್ ಅನ್ನು ನಡೆಸುವ ಒಟ್ಟು ಮಾಸಿಕ ವೆಚ್ಚವನ್ನು ಅಂದಾಜು ಮಾಡುತ್ತದೆ: ಎಂಬೆಡಿಂಗ್ ಉತ್ಪಾದನೆ, ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಹೋಸ್ಟಿಂಗ್, ಡಾಕ್ಯುಮೆಂಟ್ ಮರುಪಡೆಯುವಿಕೆ ಪ್ರಶ್ನೆಗಳು ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆ ಉತ್ಪಾದನೆಗಾಗಿ LLM ತೀರ್ಮಾನ. ಉತ್ತರಗಳನ್ನು ರಚಿಸುವ ಮೊದಲು ಸಂಬಂಧಿತ ದಾಖಲೆಗಳನ್ನು ಹಿಂಪಡೆಯುವ ಮೂಲಕ RAG ಪೈಪ್ಲೈನ್ಗಳು ನಿಮ್ಮ ಸ್ವಾಮ್ಯದ ಡೇಟಾದಲ್ಲಿ LLM ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಗ್ರೌಂಡ್ ಮಾಡುತ್ತದೆ, ಭ್ರಮೆಯನ್ನು ನಾಟಕೀಯವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಡೊಮೇನ್-ನಿರ್ದಿಷ್ಟ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗೆ ನಿಖರತೆಯನ್ನು ಸುಧಾರಿಸುತ್ತದೆ. ಇಂಜಿನಿಯರಿಂಗ್ ತಂಡಗಳಿಗೆ ಜ್ಞಾನ ನೆಲೆಗಳು, ಗ್ರಾಹಕ ಬೆಂಬಲ ವ್ಯವಸ್ಥೆಗಳು, ಆಂತರಿಕ ಹುಡುಕಾಟ ಪರಿಕರಗಳು ಮತ್ತು ನಿರ್ದಿಷ್ಟ ದಾಖಲೆಗಳು ಅಥವಾ ಡೇಟಾದ ಕುರಿತು ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸಲು LLM ಅಗತ್ಯವಿರುವ ಯಾವುದೇ ಅಪ್ಲಿಕೇಶನ್ಗೆ ಈ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಅತ್ಯಗತ್ಯ. 100,000-ಡಾಕ್ಯುಮೆಂಟ್ ಕಾರ್ಪಸ್ನೊಂದಿಗೆ ತಿಂಗಳಿಗೆ 10,000 ಪ್ರಶ್ನೆಗಳನ್ನು ಒದಗಿಸುವ ವಿಶಿಷ್ಟವಾದ RAG ಪೈಪ್ಲೈನ್ ಘಟಕ ಆಯ್ಕೆಗಳನ್ನು ಅವಲಂಬಿಸಿ ತಿಂಗಳಿಗೆ $150 ರಿಂದ $500 ವರೆಗೆ ವೆಚ್ಚವಾಗಬಹುದು, ಇದು ವಾಸ್ತುಶಿಲ್ಪಕ್ಕೆ ಬದ್ಧರಾಗುವ ಮೊದಲು ಮಾದರಿ ವೆಚ್ಚಗಳಿಗೆ ನಿರ್ಣಾಯಕವಾಗಿದೆ. ನಾಲ್ಕು ವೆಚ್ಚದ ಘಟಕಗಳು ವಿಭಿನ್ನ ಸ್ಕೇಲಿಂಗ್ ಗುಣಲಕ್ಷಣಗಳನ್ನು ಹೊಂದಿವೆ. ಎಂಬೆಡಿಂಗ್ ಪ್ರಾಥಮಿಕವಾಗಿ ಡಾಕ್ಯುಮೆಂಟ್ ನವೀಕರಣಗಳಿಗಾಗಿ ಮಾತ್ರ ಮರುಕಳಿಸುವ ಒಂದು-ಬಾರಿಯ ವೆಚ್ಚವಾಗಿದೆ. ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಹೋಸ್ಟಿಂಗ್ ಎನ್ನುವುದು ಕಾರ್ಪಸ್ ಗಾತ್ರದೊಂದಿಗೆ ಬೆಳೆಯುವ ಸ್ಥಿರ ಮಾಸಿಕ ವೆಚ್ಚವಾಗಿದೆ. ಮರುಪಡೆಯುವಿಕೆ ಪ್ರಶ್ನೆಯ ವೆಚ್ಚವು ಪ್ರಶ್ನೆಯ ಪರಿಮಾಣದೊಂದಿಗೆ ರೇಖೀಯವಾಗಿ ಅಳೆಯುತ್ತದೆ. ಮತ್ತು LLM ನಿರ್ಣಯ, ಸಾಮಾನ್ಯವಾಗಿ ಒಟ್ಟು ವೆಚ್ಚದ 60 ರಿಂದ 80 ಪ್ರತಿಶತದಷ್ಟು ದೊಡ್ಡ ಘಟಕವಾಗಿದ್ದು, ಪ್ರಶ್ನೆಯ ಪರಿಮಾಣ ಮತ್ತು ಮಾದರಿಗೆ ರವಾನಿಸಲಾದ ಮರುಪಡೆಯಲಾದ ಸಂದರ್ಭದ ಪ್ರಮಾಣ ಎರಡನ್ನೂ ಹೊಂದಿರುವ ಮಾಪಕಗಳು. ಈ ಡೈನಾಮಿಕ್ಸ್ ಅನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ತಂಡಗಳಿಗೆ ಹೆಚ್ಚು ಪರಿಣಾಮಕಾರಿ ವೆಚ್ಚದ ಚಾಲಕಗಳನ್ನು ಅತ್ಯುತ್ತಮವಾಗಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
ಸೂತ್ರ
▾
ಒಟ್ಟು ಮಾಸಿಕ RAG ವೆಚ್ಚ = ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚ + ವೆಕ್ಟರ್ DB ಮಾಸಿಕ ವೆಚ್ಚ + (ಪ್ರತಿ ತಿಂಗಳಿಗೆ ಪ್ರಶ್ನೆಗಳು x ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ ಮರುಪಡೆಯುವಿಕೆ ವೆಚ್ಚ) + (ಪ್ರತಿ ತಿಂಗಳಿಗೆ ಪ್ರಶ್ನೆಗಳು x ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ LLM ವೆಚ್ಚ). 100K ಡಾಕ್ಯುಮೆಂಟ್ಗಳನ್ನು ಹೊಂದಿರುವ ಸಿಸ್ಟಂಗಾಗಿ, 20K ಮಾಸಿಕ ಪ್ರಶ್ನೆಗಳು, ಪಠ್ಯ-ಎಂಬೆಡ್ಡಿಂಗ್-3-ಸ್ಮಾಲ್, ಪೈನ್ಕೋನ್ ಮತ್ತು GPT-4o ಬಳಸಿ: ಎಂಬೆಡಿಂಗ್ = $1.00 (ಒಂದು ಬಾರಿ, ಭೋಗ್ಯ). ವೆಕ್ಟರ್ DB = $70/ತಿಂ. ಮರುಪಡೆಯುವಿಕೆ = ಅತ್ಯಲ್ಪ. LLM = 20,000 x (3,000 ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳು x $2.50/1M + 500 ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳು x $10/1M) = $250.00. ಒಟ್ಟು = ತಿಂಗಳಿಗೆ ಸುಮಾರು $321.Variable Legend
▾
| ಚಿಹ್ನೆ | ಹೆಸರು | ಘಟಕ | ವಿವರಣೆ |
|---|---|---|---|
| D | ಡಾಕ್ಯುಮೆಂಟ್ ಕಾರ್ಪಸ್ ಗಾತ್ರ | documents | ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ನಲ್ಲಿ ಸಂಗ್ರಹವಾಗಿರುವ ಪಠ್ಯ ದಾಖಲೆಗಳ ಒಟ್ಟು ಸಂಖ್ಯೆ ಅಥವಾ ಭಾಗಗಳು, ಇದು ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚ ಮತ್ತು ವೆಕ್ಟರ್ ಸಂಗ್ರಹಣೆ ಅಗತ್ಯತೆಗಳನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ. |
| T_chunk | ಪ್ರತಿ ಚಂಕ್ಗೆ ಟೋಕನ್ಗಳು | tokens | ಪ್ರತಿ ಡಾಕ್ಯುಮೆಂಟ್ ಚಂಕ್ಗೆ ಸರಾಸರಿ ಟೋಕನ್ ಎಣಿಕೆ, RAG ಸಿಸ್ಟಮ್ಗಳಲ್ಲಿ ಅತ್ಯುತ್ತಮವಾದ ಮರುಪಡೆಯುವಿಕೆ ಗ್ರ್ಯಾನ್ಯುಲಾರಿಟಿಗಾಗಿ ಸಾಮಾನ್ಯವಾಗಿ 256 ರಿಂದ 512 ಟೋಕನ್ಗಳು. |
| K | ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ ಚಂಕ್ಸ್ ಹಿಂಪಡೆಯಲಾಗಿದೆ | chunks | ಪ್ರತಿ ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಗೆ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ನಿಂದ ಹಿಂಪಡೆಯಲಾದ ಒಂದೇ ರೀತಿಯ ಡಾಕ್ಯುಮೆಂಟ್ ಚಂಕ್ಗಳ ಸಂಖ್ಯೆ, ಸಾಮಾನ್ಯವಾಗಿ 3 ರಿಂದ 8 ಪ್ರಶ್ನೆಗಳ ಸಂಕೀರ್ಣತೆಯನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ. |
| Q | ಮಾಸಿಕ ಪ್ರಶ್ನೆಯ ಸಂಪುಟ | queries per month | ಪ್ರತಿ ತಿಂಗಳು RAG ಪೈಪ್ಲೈನ್ನಿಂದ ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲಾದ ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಗಳ ಒಟ್ಟು ಸಂಖ್ಯೆ, ಇದು ಮರುಪಡೆಯುವಿಕೆ ಮತ್ತು LLM ನಿರ್ಣಯ ವೆಚ್ಚಗಳನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. |
| C_vdb | ವೆಕ್ಟರ್ ಡಿಬಿ ಮಾಸಿಕ ವೆಚ್ಚ | USD per month | ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಸೇವೆಗಾಗಿ ಸ್ಥಿರ ಅಥವಾ ಬಳಕೆಯ-ಆಧಾರಿತ ಮಾಸಿಕ ಹೋಸ್ಟಿಂಗ್ ವೆಚ್ಚ, ಸರ್ವರ್ಲೆಸ್ಗಾಗಿ $10 ರಿಂದ ಮೀಸಲಾದ ಪಾಡ್ಗಳಿಗೆ $200 ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚು. |
| C_llm | ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ LLM ವೆಚ್ಚ | USD per query | ಮರುಪಡೆಯಲಾದ ಸಂದರ್ಭವನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸಲು ಮತ್ತು ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಉತ್ಪಾದಿಸಲು ಭಾಷಾ ಮಾದರಿಯ ನಿರ್ಣಯದ ವೆಚ್ಚ, ಸಾಮಾನ್ಯವಾಗಿ ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ $0.005 ರಿಂದ $0.05 ವರೆಗೆ ಅತಿ ದೊಡ್ಡ ಏಕ ವೆಚ್ಚದ ಘಟಕವಾಗಿದೆ. |
How to RAG Pipeline Cost Calculator
▾
- 1ನಿಮ್ಮ ಡಾಕ್ಯುಮೆಂಟ್ ಕಾರ್ಪಸ್ಗಾಗಿ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ. ಡಾಕ್ಯುಮೆಂಟ್ಗಳ ಒಟ್ಟು ಸಂಖ್ಯೆ, ವಿಭಜನೆಯ ನಂತರ ಪ್ರತಿ ಚಂಕ್ಗೆ ಸರಾಸರಿ ಟೋಕನ್ಗಳು ಮತ್ತು ಭಾಗಗಳ ನಡುವೆ ಯಾವುದೇ ಅತಿಕ್ರಮಣವನ್ನು ನಿರ್ಧರಿಸಿ. ಪ್ರತಿ ಮಿಲಿಯನ್ ಟೋಕನ್ಗಳಿಗೆ $0.02 ದರದಲ್ಲಿ ಟೆಕ್ಸ್ಟ್-ಎಂಬೆಡಿಂಗ್-3-ಸ್ಮಾಲ್ ಅನ್ನು ಬಳಸಿದರೆ, 15 ಪ್ರತಿಶತ ಅತಿಕ್ರಮಣದೊಂದಿಗೆ ಪ್ರತಿ 400 ಟೋಕನ್ಗಳಲ್ಲಿ 100,000 ಡಾಕ್ಯುಮೆಂಟ್ಗಳ ಕಾರ್ಪಸ್ ಆರಂಭಿಕ ಎಂಬೆಡಿಂಗ್ಗೆ ಸುಮಾರು $0.92 ವೆಚ್ಚವಾಗುತ್ತದೆ. ಇದು ಹೊಸ ಅಥವಾ ನವೀಕರಿಸಿದ ಡಾಕ್ಯುಮೆಂಟ್ಗಳಿಗೆ ಮಾತ್ರ ಹೆಚ್ಚುತ್ತಿರುವ ವೆಚ್ಚಗಳೊಂದಿಗೆ ತಿಂಗಳುಗಳವರೆಗೆ ಭೋಗ್ಯ ಮಾಡಲಾದ ಒಂದು-ಬಾರಿಯ ವೆಚ್ಚವಾಗಿದೆ.
- 2ನಿಮ್ಮ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಹೋಸ್ಟಿಂಗ್ ವೆಚ್ಚವನ್ನು ಅಂದಾಜು ಮಾಡಿ. ರೀಡ್ ಯೂನಿಟ್ಗಳು, ರೈಟ್ ಯೂನಿಟ್ಗಳು ಮತ್ತು ಸಂಗ್ರಹಣೆಯನ್ನು ಆಧರಿಸಿ ಪೈನ್ಕೋನ್ ಸರ್ವರ್ಲೆಸ್ ಶುಲ್ಕಗಳು. 1536 ಆಯಾಮಗಳೊಂದಿಗೆ 100,000 ವೆಕ್ಟರ್ಗಳ ಕಾರ್ಪಸ್ಗೆ ಸರಿಸುಮಾರು 600 MB ಸಂಗ್ರಹಣೆಯ ಅಗತ್ಯವಿದೆ. Pinecone ಪಾಡ್ ಆಧಾರಿತ ಯೋಜನೆಗಳು s1 ಪಾಡ್ಗೆ ತಿಂಗಳಿಗೆ $70 ರಿಂದ ಪ್ರಾರಂಭವಾಗುತ್ತವೆ. ಸಣ್ಣ ಕ್ಲಸ್ಟರ್ಗಳಿಗಾಗಿ ವೀವಿಯೇಟ್ ಕ್ಲೌಡ್ ತಿಂಗಳಿಗೆ $25 ರಿಂದ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ. ಪ್ರತಿ ತಿಂಗಳಿಗೆ $50 ರಿಂದ $150 ವರೆಗೆ ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಿದ pgvector ಸಣ್ಣ ನಿಯೋಜನೆಗಳಿಗೆ VM ಅತ್ಯಂತ ಆರ್ಥಿಕ ಆಯ್ಕೆಯಾಗಿದೆ.
- 3ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ ಮರುಪಡೆಯುವಿಕೆ ವೆಚ್ಚವನ್ನು ಲೆಕ್ಕಹಾಕಿ. ನಿರ್ವಹಿಸಲಾದ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ಗಳಿಗಾಗಿ, ಪ್ರತಿ ಹೋಲಿಕೆಯ ಹುಡುಕಾಟ ಪ್ರಶ್ನೆಯು ಒಂದು ಸೆಂಟ್ನ ಭಿನ್ನರಾಶಿಗಳನ್ನು ವೆಚ್ಚ ಮಾಡುತ್ತದೆ. ಪಿನ್ಕೋನ್ ಸರ್ವರ್ಲೆಸ್ ಪ್ರತಿ ಮಿಲಿಯನ್ ರೀಡ್ ಯೂನಿಟ್ಗಳಿಗೆ ಸರಿಸುಮಾರು $8 ಶುಲ್ಕ ವಿಧಿಸುತ್ತದೆ, ಪ್ರತಿ ಪ್ರಶ್ನೆಯು ವಿನಂತಿಸಿದ ಫಲಿತಾಂಶಗಳ ಸಂಖ್ಯೆಯನ್ನು ಅವಲಂಬಿಸಿ 5 ರಿಂದ 10 ರೀಡ್ ಯೂನಿಟ್ಗಳನ್ನು ಬಳಸುತ್ತದೆ. ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಿದ ಪರಿಹಾರಗಳಿಗಾಗಿ, ಪ್ರಶ್ನೆ ವೆಚ್ಚವು ಸ್ಥಿರ ಹೋಸ್ಟಿಂಗ್ ವೆಚ್ಚವನ್ನು ಮೀರಿ ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಶೂನ್ಯವಾಗಿರುತ್ತದೆ. ಮರುಪಡೆಯುವಿಕೆ ವೆಚ್ಚಗಳು ಸಾಮಾನ್ಯವಾಗಿ RAG ಪೈಪ್ಲೈನ್ನ ಚಿಕ್ಕ ಅಂಶವಾಗಿದೆ.
- 4ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ LLM ನಿರ್ಣಯದ ವೆಚ್ಚವನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡಿ, ಇದು ಸಾಮಾನ್ಯವಾಗಿ ಪ್ರಬಲವಾದ ವೆಚ್ಚವಾಗಿದೆ. ಪ್ರತಿ RAG ಪ್ರಶ್ನೆಯು ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಯನ್ನು ಮತ್ತು ಮರುಪಡೆಯಲಾದ ಡಾಕ್ಯುಮೆಂಟ್ ಭಾಗಗಳನ್ನು ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳಾಗಿ ಕಳುಹಿಸುತ್ತದೆ, ನಂತರ ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳಾಗಿ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು ಉತ್ಪಾದಿಸುತ್ತದೆ. ನೀವು ಪ್ರತಿಯೊಂದಕ್ಕೂ 400 ಟೋಕನ್ಗಳ 5 ಭಾಗಗಳನ್ನು ಮತ್ತು 200-ಟೋಕನ್ ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್ ಮತ್ತು 100-ಟೋಕನ್ ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಯನ್ನು ಹಿಂಪಡೆದರೆ, ಒಟ್ಟು ಇನ್ಪುಟ್ 2,300 ಟೋಕನ್ಗಳು. GPT-4o ನಲ್ಲಿ 500-ಟೋಕನ್ ಪ್ರತಿಕ್ರಿಯೆಯೊಂದಿಗೆ, ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ ಅಂದಾಜು $0.011 ವೆಚ್ಚವಾಗುತ್ತದೆ. 20,000 ಮಾಸಿಕ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ, LLM ಒಟ್ಟು $212 ವೆಚ್ಚವಾಗುತ್ತದೆ.
- 5ಕಾರ್ಪಸ್ ನವೀಕರಣಗಳಿಗಾಗಿ ಮರು-ಎಂಬೆಡ್ ಮಾಡುವ ವೆಚ್ಚಗಳನ್ನು ಸೇರಿಸಿ. ನಿಮ್ಮ ಡಾಕ್ಯುಮೆಂಟ್ಗಳಲ್ಲಿ 5 ಪ್ರತಿಶತವು ಮಾಸಿಕವಾಗಿ ಬದಲಾದರೆ, ಮರು ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವು ಆರಂಭಿಕ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚದ 5 ಪ್ರತಿಶತವಾಗಿರುತ್ತದೆ. 100,000-ಡಾಕ್ಯುಮೆಂಟ್ ಕಾರ್ಪಸ್ಗೆ, ಇದು ತಿಂಗಳಿಗೆ ಸರಿಸುಮಾರು $0.05 ಅನ್ನು ಸೇರಿಸುತ್ತದೆ, ಇದು ಅತ್ಯಲ್ಪವಾಗಿದೆ. ಆದಾಗ್ಯೂ, ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್ಗಳನ್ನು ಅಪ್ಗ್ರೇಡ್ ಮಾಡುವಾಗ ನೀವು ಸಂಪೂರ್ಣ ಕಾರ್ಪಸ್ ಅನ್ನು ಮರು ಎಂಬೆಡ್ ಮಾಡಿದರೆ (ವಾರ್ಷಿಕವಾಗಿ ಶಿಫಾರಸು ಮಾಡಲಾಗುತ್ತದೆ), ಪೂರ್ಣ ಆರಂಭಿಕ ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವನ್ನು ಆವರ್ತಕ ವೆಚ್ಚವಾಗಿ ಬಜೆಟ್ ಮಾಡಿ.
- 6ಅಭಿವೃದ್ಧಿ ಮತ್ತು ಕಾರ್ಯಾಚರಣೆಯ ಓವರ್ಹೆಡ್ನಲ್ಲಿ ಅಂಶ. RAG ಪೈಪ್ಲೈನ್ಗಳಿಗೆ ಮರುಪಡೆಯುವಿಕೆ ಗುಣಮಟ್ಟ, ಚುಂಕಿಂಗ್ ತಂತ್ರ ಶ್ರುತಿ ಮತ್ತು ಸಾಂದರ್ಭಿಕ ಮರು-ಸೂಚಿಕೆಗಾಗಿ ಮೇಲ್ವಿಚಾರಣೆಯ ಅಗತ್ಯವಿರುತ್ತದೆ. ಉತ್ಪಾದನಾ RAG ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ವಹಿಸಲು ಇಂಜಿನಿಯರಿಂಗ್ ಸಮಯವು ಪ್ರತಿ ಗಂಟೆಗೆ $100 ರಿಂದ $200 ರಂತೆ ತಿಂಗಳಿಗೆ 5 ರಿಂದ 10 ಗಂಟೆಗಳವರೆಗೆ ವೆಚ್ಚವಾಗುತ್ತದೆ, $500 ರಿಂದ $2,000 ಕಾರ್ಮಿಕ ವೆಚ್ಚವನ್ನು ಸೇರಿಸುತ್ತದೆ. ನೇರ ಮೂಲಸೌಕರ್ಯ ವೆಚ್ಚವಲ್ಲದಿದ್ದರೂ, ಈ ಕಾರ್ಯಾಚರಣೆಯ ಓವರ್ಹೆಡ್ ಅನ್ನು ಮಾಲೀಕತ್ವದ ಲೆಕ್ಕಾಚಾರಗಳ ಒಟ್ಟು ವೆಚ್ಚದಲ್ಲಿ ಸೇರಿಸಬೇಕು.
- 7ಪ್ರತಿ ಘಟಕವನ್ನು ಒಟ್ಟು ವೆಚ್ಚದ ಶೇಕಡಾವಾರು ಎಂದು ತೋರಿಸುವ ಸಂಪೂರ್ಣ ವೆಚ್ಚದ ಸ್ಥಗಿತವನ್ನು ಪರಿಶೀಲಿಸಿ. ಹೆಚ್ಚಿನ RAG ವ್ಯವಸ್ಥೆಗಳಿಗೆ, LLM ನಿರ್ಣಯವು 60 ರಿಂದ 80 ಪ್ರತಿಶತದವರೆಗೆ ಪ್ರಾಬಲ್ಯ ಹೊಂದಿದೆ, ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಹೋಸ್ಟಿಂಗ್ ಖಾತೆಗಳು 15 ರಿಂದ 30 ಪ್ರತಿಶತ, ಮತ್ತು ಎಂಬೆಡಿಂಗ್ ಮತ್ತು ಮರುಪಡೆಯುವಿಕೆ ಒಟ್ಟಾಗಿ 5 ಪ್ರತಿಶತಕ್ಕಿಂತ ಕಡಿಮೆ ಪ್ರತಿನಿಧಿಸುತ್ತದೆ. ಈ ವಿತರಣೆಯು ಮಾದರಿ ಆಯ್ಕೆ, ಪ್ರಾಂಪ್ಟ್ ಕಂಪ್ರೆಷನ್ ಅಥವಾ ಹಿಂಪಡೆಯಲಾದ ಚಂಕ್ ಸಂಖ್ಯೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ LLM ವೆಚ್ಚವನ್ನು ಉತ್ತಮಗೊಳಿಸುವುದು ಒಟ್ಟು ವೆಚ್ಚದ ಮೇಲೆ ಹೆಚ್ಚಿನ ಪರಿಣಾಮವನ್ನು ಬೀರುತ್ತದೆ.
Worked Examples
▾
ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವು ಒಂದು ಬಾರಿ $0.06 ನಲ್ಲಿ ಅತ್ಯಲ್ಪವಾಗಿದೆ. ವೆಕ್ಟರ್ ಡಿಬಿ ಸರ್ವರ್ಲೆಸ್ ಈ ಪ್ರಮಾಣದಲ್ಲಿ ತಿಂಗಳಿಗೆ ಸುಮಾರು $10 ವೆಚ್ಚವಾಗುತ್ತದೆ. GPT-4o-mini ಜೊತೆಗಿನ LLM ವೆಚ್ಚವು ತಿಂಗಳಿಗೆ ಸರಿಸುಮಾರು $32 ಆಗಿದೆ (5,000 ಪ್ರಶ್ನೆಗಳು x 1,400 ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳು x $0.15/1M + 300 ಔಟ್ಪುಟ್ x $0.60/1M). ಇದು ಸಣ್ಣ ವ್ಯಾಪಾರಗಳಿಗೆ ಕೈಗೆಟುಕುವ RAG ಸೆಟಪ್ ಆಗಿದೆ.
1M ವೆಕ್ಟರ್ಗಳನ್ನು ನಿರ್ವಹಿಸುವ p2 ಪಾಡ್ಗೆ ವೆಕ್ಟರ್ DB ತಿಂಗಳಿಗೆ $200 ವೆಚ್ಚವಾಗುತ್ತದೆ. LLM ತೀರ್ಮಾನವು ತಿಂಗಳಿಗೆ $1,950 ನಲ್ಲಿ ಪ್ರಾಬಲ್ಯ ಹೊಂದಿದೆ: $3/1M ನಲ್ಲಿ 3,200 ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳೊಂದಿಗೆ (6 ಚಂಕ್ಗಳು x 500 + ಓವರ್ಹೆಡ್) 50,000 ಪ್ರಶ್ನೆಗಳು ಮತ್ತು $15/1M ನಲ್ಲಿ 600 ಔಟ್ಪುಟ್ ಟೋಕನ್ಗಳು. ಎಂಬೆಡಿಂಗ್ ಭೋಗ್ಯ ವೆಚ್ಚವು ತಿಂಗಳಿಗೆ ಸುಮಾರು $25 ಅನ್ನು ಸೇರಿಸುತ್ತದೆ.
ತಿಂಗಳಿಗೆ $80 ನಲ್ಲಿ ಸ್ವಯಂ-ಹೋಸ್ಟ್ ಮಾಡಿದ pgvector ನಿರ್ವಹಿಸಿದ ಡೇಟಾಬೇಸ್ ಪ್ರೀಮಿಯಂ ಅನ್ನು ತಪ್ಪಿಸುತ್ತದೆ. GPT-4o-mini $0.15/$0.60 ನಲ್ಲಿ 30,000 ಪ್ರಶ್ನೆಗಳಿಗೆ LLM ವೆಚ್ಚವನ್ನು ತಿಂಗಳಿಗೆ $99 ಗೆ ಇರಿಸುತ್ತದೆ. ಎಂಬೆಡಿಂಗ್ ವೆಚ್ಚವು ತಿಂಗಳಿಗೆ $3 ಅನ್ನು ಸೇರಿಸುತ್ತದೆ. ಈ ವಾಸ್ತುಶಿಲ್ಪವು 90 ಪ್ರತಿಶತದಷ್ಟು ಎಂಟರ್ಪ್ರೈಸ್ RAG ಗುಣಮಟ್ಟವನ್ನು ತಿಂಗಳಿಗೆ $200 ಅಡಿಯಲ್ಲಿ ನೀಡುತ್ತದೆ.
Real-World Applications
▾
ಗ್ರಾಹಕರ ಪ್ರಶ್ನೆಗಳಿಗೆ ತ್ವರಿತ, ನಿಖರವಾದ ಉತ್ತರಗಳನ್ನು ಒದಗಿಸಲು ಗ್ರಾಹಕ ಬೆಂಬಲ ವೇದಿಕೆಗಳು ತಮ್ಮ ಸಹಾಯ ದಾಖಲಾತಿ ಮತ್ತು ಹಿಂದಿನ ಟಿಕೆಟ್ ರೆಸಲ್ಯೂಶನ್ಗಳ ಮೇಲೆ RAG ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸುತ್ತವೆ. GPT-4o-mini RAG ಪೈಪ್ಲೈನ್ ಮೂಲಕ 100,000 ಮಾಸಿಕ ಬೆಂಬಲ ಪ್ರಶ್ನೆಗಳನ್ನು ಒದಗಿಸುವ 50,000 ಸಹಾಯ ಲೇಖನಗಳನ್ನು ಹೊಂದಿರುವ SaaS ಕಂಪನಿಯು ತಿಂಗಳಿಗೆ ಸರಿಸುಮಾರು $400 ಖರ್ಚು ಮಾಡುತ್ತದೆ. ಇದು 60 ರಿಂದ 70 ಪ್ರತಿಶತ ಪ್ರಶ್ನೆಗಳನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ನಿರ್ವಹಿಸುತ್ತದೆ, 24/7 ತ್ವರಿತ ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಒದಗಿಸುವಾಗ ಮಾನವ ಏಜೆಂಟ್ ವೆಚ್ಚದಲ್ಲಿ ತಿಂಗಳಿಗೆ $50,000 ರಿಂದ $80,000 ಉಳಿಸುತ್ತದೆ.
ನೈಸರ್ಗಿಕ ಭಾಷಾ ಪ್ರಶ್ನೆಗಳ ಮೂಲಕ ಸಂಬಂಧಿತ ಪೂರ್ವನಿದರ್ಶನಗಳನ್ನು ಹುಡುಕಲು ವಕೀಲರನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಲು ಕಾನೂನು ಸಂಶೋಧನಾ ವೇದಿಕೆಗಳು ಲಕ್ಷಾಂತರ ನ್ಯಾಯಾಲಯದ ಅಭಿಪ್ರಾಯಗಳು, ಕಾನೂನುಗಳು ಮತ್ತು ನಿಬಂಧನೆಗಳನ್ನು ಎಂಬೆಡ್ ಮಾಡುತ್ತವೆ. ವಿಶ್ಲೇಷಣೆಗಾಗಿ ಕ್ಲೌಡ್ ಸಾನೆಟ್ 4 ಮತ್ತು ಮರುಪಡೆಯುವಿಕೆಗಾಗಿ ಪೈನ್ಕೋನ್ ಅನ್ನು ಬಳಸಿಕೊಂಡು 5 ಮಿಲಿಯನ್ ಡಾಕ್ಯುಮೆಂಟ್ ಚಂಕ್ಗಳನ್ನು ಹೊಂದಿರುವ ಕಾನೂನುಬದ್ಧ AI ಪ್ರಾರಂಭವು 20,000 ಸಂಕೀರ್ಣ ಕಾನೂನು ಪ್ರಶ್ನೆಗಳನ್ನು ಪೂರೈಸಲು ತಿಂಗಳಿಗೆ ಸರಿಸುಮಾರು $5,000 ಖರ್ಚು ಮಾಡುತ್ತದೆ. 30 ರಿಂದ 60 ನಿಮಿಷಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ 10 ಸೆಕೆಂಡ್ಗಳಲ್ಲಿ ಉತ್ತರಿಸಲಾಗುತ್ತದೆ.
ಹೆಲ್ತ್ಕೇರ್ ಸಂಸ್ಥೆಗಳು ವೈದ್ಯರಿಗೆ ಸಾಕ್ಷ್ಯ ಆಧಾರಿತ ನಿರ್ಧಾರ ಬೆಂಬಲವನ್ನು ಒದಗಿಸಲು ವೈದ್ಯಕೀಯ ಮಾರ್ಗಸೂಚಿಗಳು, ಔಷಧ ಡೇಟಾಬೇಸ್ಗಳು ಮತ್ತು ವೈದ್ಯಕೀಯ ಸಾಹಿತ್ಯದ ಮೇಲೆ RAG ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸುತ್ತವೆ. 15,000 ಮಾಸಿಕ ವೈದ್ಯರ ಪ್ರಶ್ನೆಗಳಿಗೆ ಸೇವೆ ಸಲ್ಲಿಸುವ 2 ಮಿಲಿಯನ್ ವೈದ್ಯಕೀಯ ದಾಖಲೆಗಳನ್ನು ಹೊಂದಿರುವ ಆಸ್ಪತ್ರೆ ವ್ಯವಸ್ಥೆಯು ತಿಂಗಳಿಗೆ ಸುಮಾರು $1,200 ಖರ್ಚು ಮಾಡುತ್ತದೆ. RAG ವ್ಯವಸ್ಥೆಯು ಪ್ರತಿ ಉತ್ತರದಲ್ಲಿ ನಿರ್ದಿಷ್ಟ ಮಾರ್ಗದರ್ಶಿ ವಿಭಾಗಗಳು ಮತ್ತು ಸಂಶೋಧನಾ ಪ್ರಬಂಧಗಳನ್ನು ಉಲ್ಲೇಖಿಸುತ್ತದೆ, ವೈದ್ಯಕೀಯ ಸೆಟ್ಟಿಂಗ್ಗಳಲ್ಲಿ ಅಗತ್ಯವಿರುವ ಪತ್ತೆಹಚ್ಚುವಿಕೆಯನ್ನು ಒದಗಿಸುತ್ತದೆ.
ಸಂಬಂಧಿತ ಉತ್ಪನ್ನ ವಿಶೇಷಣಗಳು, ವಿಮರ್ಶೆಗಳು ಮತ್ತು ಹೋಲಿಕೆ ಡೇಟಾವನ್ನು ಹಿಂಪಡೆಯುವ ಮೂಲಕ ಉತ್ಪನ್ನಗಳ ಕುರಿತು ವಿವರವಾದ ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸಬಹುದಾದ ಉತ್ಪನ್ನ ಶಿಫಾರಸು ಚಾಟ್ಬಾಟ್ಗಳಿಗೆ ಶಕ್ತಿ ನೀಡಲು ಇ-ಕಾಮರ್ಸ್ ಕಂಪನಿಗಳು RAG ಅನ್ನು ಬಳಸುತ್ತವೆ. GPT-4o-mini RAG ಪೈಪ್ಲೈನ್ ಮೂಲಕ 200,000 ಮಾಸಿಕ ಶಾಪರ್ ಪ್ರಶ್ನೆಗಳನ್ನು ಪೂರೈಸುವ 500,000 ಉತ್ಪನ್ನ ಪುಟಗಳನ್ನು ಹೊಂದಿರುವ ಚಿಲ್ಲರೆ ವ್ಯಾಪಾರಿಯು ತಿಂಗಳಿಗೆ ಸರಿಸುಮಾರು $800 ಖರ್ಚು ಮಾಡುತ್ತಾರೆ. ಇದು ಗ್ರಾಹಕರು ಸರಿಯಾದ ಉತ್ಪನ್ನಗಳನ್ನು ವೇಗವಾಗಿ ಹುಡುಕಲು ಸಹಾಯ ಮಾಡುವ ಮೂಲಕ ಪರಿವರ್ತನೆ ದರಗಳನ್ನು 15 ರಿಂದ 25 ಪ್ರತಿಶತದಷ್ಟು ಹೆಚ್ಚಿಸುತ್ತದೆ.
Special Cases
▾
ನೈಜ-ಸಮಯದ ಡೇಟಾ ಅಪ್ಡೇಟ್ಗಳನ್ನು ನಿರ್ವಹಿಸಬೇಕಾದ RAG ಸಿಸ್ಟಮ್ಗಳಿಗಾಗಿ (ಉದಾಹರಣೆಗೆ ಸುದ್ದಿ ಫೀಡ್ಗಳು,
ನೈಜ-ಸಮಯದ ಡೇಟಾ ನವೀಕರಣಗಳನ್ನು (ಸುದ್ದಿ ಫೀಡ್ಗಳು, ಸ್ಟಾಕ್ ಬೆಲೆಗಳು ಅಥವಾ ಲೈವ್ ಡಾಕ್ಯುಮೆಂಟೇಶನ್ನಂತಹ) ನಿರ್ವಹಿಸಬೇಕಾದ RAG ಸಿಸ್ಟಮ್ಗಳಿಗೆ ಸಾಂಪ್ರದಾಯಿಕ ಬ್ಯಾಚ್ ಎಂಬೆಡಿಂಗ್ ಮತ್ತು ಇಂಡೆಕ್ಸಿಂಗ್ ವಿಧಾನವು ಸ್ವೀಕಾರಾರ್ಹವಲ್ಲದ ಲೇಟೆನ್ಸಿಯನ್ನು ಪರಿಚಯಿಸುತ್ತದೆ. ಸ್ಟ್ರೀಮಿಂಗ್ RAG ಆರ್ಕಿಟೆಕ್ಚರ್ಗಳು ಎಂಬೆಡ್ ಮಾಡುವ ಮತ್ತು ರಚನೆಯ ಸೆಕೆಂಡುಗಳಲ್ಲಿ ದಾಖಲೆಗಳನ್ನು ಸೂಚ್ಯಂಕ ಮಾಡುವುದು ಯಾವಾಗಲೂ ಆನ್ ಎಂಬೆಡಿಂಗ್ ಸೇವೆಗಳು ಮತ್ತು ವೇಗದ ಬರವಣಿಗೆ ಕಾರ್ಯಕ್ಷಮತೆಯೊಂದಿಗೆ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ಗಳ ಅಗತ್ಯವಿರುತ್ತದೆ. ಬ್ಯಾಚ್ ಪ್ರಕ್ರಿಯೆಗೆ ಹೋಲಿಸಿದರೆ ಇದು ಎಂಬೆಡಿಂಗ್ ಮೂಲಸೌಕರ್ಯ ವೆಚ್ಚವನ್ನು 5 ರಿಂದ 10 ಪಟ್ಟು ಹೆಚ್ಚಿಸಬಹುದು, ಏಕೆಂದರೆ ನೀವು ನಿಯತಕಾಲಿಕ ಬ್ಯಾಚ್ ಉದ್ಯೋಗಗಳಿಗಿಂತ ನಿರಂತರ ಕಂಪ್ಯೂಟ್ಗಾಗಿ ಪಾವತಿಸುತ್ತಿದ್ದೀರಿ.
ಬಹು-ಮಾದರಿ RAG ವ್ಯವಸ್ಥೆಗಳು ಚಿತ್ರಗಳು, ಕೋಷ್ಟಕಗಳು ಮತ್ತು ಅವುಗಳ ಮೇಲೆ ಹಿಂಪಡೆಯುತ್ತವೆ ಮತ್ತು ಕಾರಣವಾಗುತ್ತವೆ
ಪಠ್ಯದ ಜೊತೆಗೆ ಚಿತ್ರಗಳು, ಕೋಷ್ಟಕಗಳು ಮತ್ತು ರೇಖಾಚಿತ್ರಗಳ ಮೇಲೆ ಹಿಂಪಡೆಯುವ ಮತ್ತು ಕಾರಣವಾಗುವ ಬಹು-ಮಾದರಿ RAG ವ್ಯವಸ್ಥೆಗಳು ಗಣನೀಯವಾಗಿ ಹೆಚ್ಚಿನ ವೆಚ್ಚವನ್ನು ಎದುರಿಸುತ್ತವೆ. ಡಾಕ್ಯುಮೆಂಟ್ ಚಿತ್ರಗಳನ್ನು ಎಂಬೆಡಿಂಗ್ಗಳಿಗೆ ಪರಿವರ್ತಿಸಲು ಪ್ರತಿ ಟೋಕನ್ಗೆ ಪಠ್ಯ ಎಂಬೆಡಿಂಗ್ಗಳಿಗಿಂತ 5 ರಿಂದ 20 ಪಟ್ಟು ಹೆಚ್ಚು ವೆಚ್ಚವಾಗುವ ದೃಷ್ಟಿ ಮಾದರಿಗಳ ಅಗತ್ಯವಿದೆ. ಪಠ್ಯ ಎಂಬೆಡಿಂಗ್ಗಳ ಜೊತೆಗೆ ಇಮೇಜ್ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಸಂಗ್ರಹಿಸುವುದು ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಗಾತ್ರವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಮತ್ತು GPT-4o ದೃಷ್ಟಿಯಂತಹ ಬಹು-ಮಾದರಿ LLM ಗಳಿಗೆ ಮರುಪಡೆಯಲಾದ ಚಿತ್ರಗಳನ್ನು ರವಾನಿಸುವುದು ಪ್ರತಿ ಚಿತ್ರಕ್ಕೆ 500 ರಿಂದ 2,000 ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತದೆ. ಬಹು-ಮಾದರಿ RAG ಪೈಪ್ಲೈನ್ ಪಠ್ಯ-ಮಾತ್ರ ಸಮಾನಕ್ಕಿಂತ 3 ರಿಂದ 5 ಪಟ್ಟು ಹೆಚ್ಚು ವೆಚ್ಚವಾಗಬಹುದು.
ಹೆಲ್ತ್ಕೇರ್ ಮತ್ತು ಫೈನಾನ್ಸ್ನಂತಹ ಹೆಚ್ಚು ನಿಯಂತ್ರಿತ ಉದ್ಯಮಗಳಿಗೆ, ಆರ್ಎಜಿ ಪೈಪ್ಲೈನ್ಗಳು ಕಡ್ಡಾಯವಾಗಿದೆ
ಹೆಲ್ತ್ಕೇರ್ ಮತ್ತು ಫೈನಾನ್ಸ್ನಂತಹ ಹೆಚ್ಚು ನಿಯಂತ್ರಿತ ಉದ್ಯಮಗಳಿಗೆ, RAG ಪೈಪ್ಲೈನ್ಗಳು ಆಡಿಟ್ ಲಾಗಿಂಗ್, ಪ್ರವೇಶ ನಿಯಂತ್ರಣಗಳು ಮತ್ತು ಮೂಲಸೌಕರ್ಯ ಸಂಕೀರ್ಣತೆ ಮತ್ತು ವೆಚ್ಚವನ್ನು ಸೇರಿಸುವ ಡೇಟಾ ಲೈನ್ ಟ್ರ್ಯಾಕಿಂಗ್ ಅನ್ನು ಒಳಗೊಂಡಿರಬೇಕು. ಅನುಸರಣೆ ಉದ್ದೇಶಗಳಿಗಾಗಿ ಪ್ರಶ್ನೆ ಲಾಗ್ಗಳು, ಮರುಪಡೆಯಲಾದ ದಾಖಲೆಗಳು ಮತ್ತು LLM ಪ್ರತಿಕ್ರಿಯೆಗಳನ್ನು ಸಂಗ್ರಹಿಸುವುದು ಹೆಚ್ಚುವರಿ ಶೇಖರಣಾ ವೆಚ್ಚದಲ್ಲಿ ತಿಂಗಳಿಗೆ $50 ರಿಂದ $200 ವರೆಗೆ ಸೇರಿಸಬಹುದು. ಡೇಟಾ ರೆಸಿಡೆನ್ಸಿ ಅವಶ್ಯಕತೆಗಳನ್ನು ಪೂರೈಸಲು ಖಾಸಗಿ VPC ಅಥವಾ ಆನ್-ಆವರಣದ ಪರಿಸರದಲ್ಲಿ ಸಂಪೂರ್ಣ ಪೈಪ್ಲೈನ್ ಅನ್ನು ಚಾಲನೆ ಮಾಡುವುದರಿಂದ ಪ್ರಮಾಣಿತ ಕ್ಲೌಡ್ ನಿಯೋಜನೆಗಳಿಗೆ ಹೋಲಿಸಿದರೆ ಮೂಲಸೌಕರ್ಯ ವೆಚ್ಚವನ್ನು 2 ರಿಂದ 3 ಪಟ್ಟು ಹೆಚ್ಚಿಸಬಹುದು.
RAG ಪೈಪ್ಲೈನ್ ಕಾಂಪೊನೆಂಟ್ ವೆಚ್ಚ ಶ್ರೇಣಿಗಳು (2025)
▾
| ಘಟಕ | ಬಜೆಟ್ ಆಯ್ಕೆ | ಮಧ್ಯ ಶ್ರೇಣಿಯ ಆಯ್ಕೆ | ಎಂಟರ್ಪ್ರೈಸ್ ಆಯ್ಕೆ |
|---|---|---|---|
| ಎಂಬೆಡಿಂಗ್ (100K ಡಾಕ್ಸ್) | $0.06 (3-ಸಣ್ಣ) | $0.92 (3-ಸಣ್ಣ + ಅತಿಕ್ರಮಣ) | $9.20 (3-ದೊಡ್ಡ + ಅತಿಕ್ರಮಣ) |
| ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ | $0-50/ತಿಂ (pgvector) | $70-100/ತಿಂ (Pinecone s1) | $200-500/ತಿಂ (Pinecone p2) |
| ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ LLM | $0.001 (GPT-4o-mini) | $0.011 (GPT-4o) | $0.025 (ಕ್ಲಾಡ್ ಸಾನೆಟ್ 4) |
| ಮಾಸಿಕ (10K ಪ್ರಶ್ನೆಗಳು) | $60-100 | $180-300 | $450-750 |
| ಮಾಸಿಕ (100K ಪ್ರಶ್ನೆಗಳು) | $150-350 | $1,200-1,800 | $2,800-4,500 |
Frequently Asked Questions
▾
RAG ಪೈಪ್ಲೈನ್ನಲ್ಲಿ ಅತಿ ಹೆಚ್ಚು ವೆಚ್ಚದ ಚಾಲಕ ಯಾವುದು?
LLM ನಿರ್ಣಯವು ಪ್ರಬಲವಾದ ವೆಚ್ಚವಾಗಿದೆ, ಸಾಮಾನ್ಯವಾಗಿ ಒಟ್ಟು ಮಾಸಿಕ ವೆಚ್ಚದ 60 ರಿಂದ 80 ಪ್ರತಿಶತವನ್ನು ಹೊಂದಿದೆ. ಏಕೆಂದರೆ ಪ್ರತಿ ಪ್ರಶ್ನೆಯು ಸಾವಿರಾರು ಹಿಂಪಡೆದ ಸಂದರ್ಭ ಟೋಕನ್ಗಳನ್ನು ಮತ್ತು ಬಳಕೆದಾರರ ಪ್ರಶ್ನೆಯನ್ನು LLM ಗೆ ಕಳುಹಿಸುತ್ತದೆ. ಅತ್ಯಂತ ಪರಿಣಾಮಕಾರಿ ವೆಚ್ಚ ಆಪ್ಟಿಮೈಸೇಶನ್ ತಂತ್ರಗಳು ಈ ಘಟಕವನ್ನು ಗುರಿಯಾಗಿಸಿಕೊಂಡಿವೆ: GPT-4o-mini ನಂತಹ ಅಗ್ಗದ ಮಾದರಿಗಳನ್ನು ಬಳಸುವುದು, ಹಿಂಪಡೆಯಲಾದ ಭಾಗಗಳ ಸಂಖ್ಯೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುವುದು, LLM ಗೆ ಕಳುಹಿಸುವ ಮೊದಲು ಸಂದರ್ಭವನ್ನು ಸಂಕುಚಿತಗೊಳಿಸುವುದು ಮತ್ತು ಆಗಾಗ್ಗೆ ಪ್ರಶ್ನೆ ಫಲಿತಾಂಶಗಳನ್ನು ಹಿಡಿದಿಟ್ಟುಕೊಳ್ಳುವುದು.
Pinecone, Weaviate ಮತ್ತು pgvector ನಡುವೆ ನಾನು ಹೇಗೆ ಆಯ್ಕೆ ಮಾಡುವುದು?
ಪೈನ್ಕೋನ್ ಅನ್ನು ಹೊಂದಿಸಲು ಮತ್ತು ಅಳೆಯಲು ಸುಲಭವಾಗಿದೆ ಆದರೆ ದೊಡ್ಡ ನಿಯೋಜನೆಗಳಿಗೆ ಇದು ಅತ್ಯಂತ ದುಬಾರಿಯಾಗಿದೆ. Weaviate ವೈಶಿಷ್ಟ್ಯಗಳ ಉತ್ತಮ ಸಮತೋಲನವನ್ನು ನೀಡುತ್ತದೆ ಮತ್ತು ಉದಾರವಾದ ಉಚಿತ ಶ್ರೇಣಿಯೊಂದಿಗೆ ವೆಚ್ಚವನ್ನು ನೀಡುತ್ತದೆ. ಯಾವುದೇ ಪ್ರಮಾಣಿತ ಡೇಟಾಬೇಸ್ ಸರ್ವರ್ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿರುವ PostgreSQL ಪರಿಣತಿಯನ್ನು ಹೊಂದಿರುವ ತಂಡಗಳಿಗೆ pgvector ಅಗ್ಗದ ಆಯ್ಕೆಯಾಗಿದೆ. 100,000 ವೆಕ್ಟರ್ಗಳ ಅಡಿಯಲ್ಲಿ ಕಾರ್ಪೋರಾಗೆ, $50 VM ನಲ್ಲಿ pgvector ಸಾಮಾನ್ಯವಾಗಿ ಸಾಕಾಗುತ್ತದೆ. 100,000 ರಿಂದ 10 ಮಿಲಿಯನ್ ವೆಕ್ಟರ್ಗಳಿಗೆ, ಪೈನ್ಕೋನ್ ಸರ್ವರ್ಲೆಸ್ ಅಥವಾ ವೀವಿಯೇಟ್ ಕ್ಲೌಡ್ ಉತ್ತಮ ಕಾರ್ಯಕ್ಷಮತೆಯಿಂದ ವೆಚ್ಚದ ಅನುಪಾತಗಳನ್ನು ನೀಡುತ್ತದೆ.
ಪ್ರತಿ ಪ್ರಶ್ನೆಗೆ ನಾನು ಎಷ್ಟು ಭಾಗಗಳನ್ನು ಹಿಂಪಡೆಯಬೇಕು?
3 ರಿಂದ 5 ಭಾಗಗಳೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ ಮತ್ತು ಉತ್ತರದ ಗುಣಮಟ್ಟವನ್ನು ಅಳೆಯಿರಿ. ಹೆಚ್ಚಿನ ಭಾಗಗಳನ್ನು ಹಿಂಪಡೆಯುವುದು ಹೆಚ್ಚಿನ ಸಂದರ್ಭವನ್ನು ಒದಗಿಸುತ್ತದೆ ಆದರೆ LLM ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳು ಮತ್ತು ವೆಚ್ಚವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. 5 ರಿಂದ 7 ಭಾಗಗಳ ಆಚೆಗೆ, ಹೆಚ್ಚುವರಿ ಸಂದರ್ಭವು ಸಾಮಾನ್ಯವಾಗಿ ಅನಗತ್ಯ ಅಥವಾ ಅಪ್ರಸ್ತುತ ಮಾಹಿತಿಯನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ ಅದು ಮಾದರಿಯನ್ನು ಗೊಂದಲಗೊಳಿಸಬಹುದು ಮತ್ತು ಉತ್ತರದ ಗುಣಮಟ್ಟವನ್ನು ಕುಗ್ಗಿಸಬಹುದು. 10 ರಿಂದ 20 ಅಭ್ಯರ್ಥಿಗಳ ಆರಂಭಿಕ ಮರುಪಡೆಯುವಿಕೆಯಿಂದ ಹೆಚ್ಚು ಸೂಕ್ತವಾದ 3 ರಿಂದ 5 ಭಾಗಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ಮರು-ಶ್ರೇಣಿಯ ಹಂತವನ್ನು (ಉದಾಹರಣೆಗೆ ಕೊಹೆರ್ ರೆರಾಂಕ್ ಅಥವಾ ಕ್ರಾಸ್-ಎನ್ಕೋಡರ್ ಮಾದರಿ) ಬಳಸಿ.
ಉತ್ಪಾದನೆ RAG ಗಾಗಿ ನಾನು ಉಚಿತ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಅನ್ನು ಬಳಸಬಹುದೇ?
ಹೌದು, ಸಣ್ಣ ಮತ್ತು ಮಧ್ಯಮ ನಿಯೋಜನೆಗಳಿಗಾಗಿ. ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ PostgreSQL ಸರ್ವರ್ನಲ್ಲಿ ಚಾಲನೆಯಲ್ಲಿರುವ pgvector ಶೂನ್ಯ ಹೆಚ್ಚುವರಿ ವೆಚ್ಚವನ್ನು ಸೇರಿಸುತ್ತದೆ. ಕ್ರೋಮಾ ಮತ್ತು FAISS 1 ಮಿಲಿಯನ್ ವೆಕ್ಟರ್ಗಳ ಅಡಿಯಲ್ಲಿ ಕಾರ್ಪೋರಾದಲ್ಲಿ ಮೆಮೊರಿಯಲ್ಲಿ ರನ್ ಮಾಡಬಹುದು. Weaviate Cloud ಅಭಿವೃದ್ಧಿ ಮತ್ತು ಸಣ್ಣ ಉತ್ಪಾದನಾ ಕೆಲಸದ ಹೊರೆಗಳಿಗೆ ಸೂಕ್ತವಾದ ಉಚಿತ ಸ್ಯಾಂಡ್ಬಾಕ್ಸ್ ಶ್ರೇಣಿಯನ್ನು ನೀಡುತ್ತದೆ. ಈ ಆಯ್ಕೆಗಳು ಮಧ್ಯಮ ಪ್ರಶ್ನೆಯ ಪರಿಮಾಣಗಳೊಂದಿಗೆ 100,000 ರಿಂದ 500,000 ವೆಕ್ಟರ್ಗಳಿಗೆ ಕಾರ್ಯಸಾಧ್ಯವಾಗಿವೆ, ಆದರೂ ಅವು ಪಾವತಿಸಿದ ನಿರ್ವಹಿಸಿದ ಸೇವೆಗಳ ವಿಶ್ವಾಸಾರ್ಹತೆಯ ಖಾತರಿಗಳನ್ನು ಹೊಂದಿರುವುದಿಲ್ಲ.
ಚಂಕಿಂಗ್ ತಂತ್ರವು RAG ವೆಚ್ಚಗಳ ಮೇಲೆ ಹೇಗೆ ಪರಿಣಾಮ ಬೀರುತ್ತದೆ?
ಸಣ್ಣ ಭಾಗಗಳು (128 ರಿಂದ 256 ಟೋಕನ್ಗಳು) ಸಂಗ್ರಹಿಸಲಾದ ಮತ್ತು ಹಿಂಪಡೆಯಲಾದ ವೆಕ್ಟರ್ಗಳ ಸಂಖ್ಯೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತವೆ ಆದರೆ ಹೆಚ್ಚು ನಿಖರವಾದ ಸಂದರ್ಭವನ್ನು ಒದಗಿಸುತ್ತವೆ. ದೊಡ್ಡ ಭಾಗಗಳು (512 ರಿಂದ 1024 ಟೋಕನ್ಗಳು) ವೆಕ್ಟರ್ ಸಂಖ್ಯೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಆದರೆ ಪ್ರತಿ ಮರುಪಡೆಯುವಿಕೆಯಲ್ಲಿ ಅಪ್ರಸ್ತುತ ವಿಷಯವನ್ನು ಒಳಗೊಂಡಿರಬಹುದು. ಸೂಕ್ತವಾದ ಚಂಕ್ ಗಾತ್ರವು ನಿಮ್ಮ ಡಾಕ್ಯುಮೆಂಟ್ ಪ್ರಕಾರ ಮತ್ತು ಪ್ರಶ್ನೆ ಮಾದರಿಗಳನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ. ಹೆಚ್ಚಿನ ಬಳಕೆಯ ಸಂದರ್ಭಗಳಲ್ಲಿ, 50 ರಿಂದ 100 ಟೋಕನ್ ಅತಿಕ್ರಮಣದೊಂದಿಗೆ 256 ರಿಂದ 512 ಟೋಕನ್ಗಳು ಮರುಪಡೆಯುವಿಕೆ ನಿಖರತೆ ಮತ್ತು ವೆಚ್ಚದ ದಕ್ಷತೆಯ ಅತ್ಯುತ್ತಮ ಸಮತೋಲನವನ್ನು ಒದಗಿಸುತ್ತದೆ.
ಮೊದಲಿನಿಂದ RAG ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸಲು ಒಟ್ಟು ವೆಚ್ಚ ಎಷ್ಟು?
ಉತ್ಪಾದನಾ RAG ವ್ಯವಸ್ಥೆಗೆ ಅಭಿವೃದ್ಧಿ ವೆಚ್ಚವು ಸಾಮಾನ್ಯವಾಗಿ 80 ರಿಂದ 200 ಇಂಜಿನಿಯರಿಂಗ್ ಗಂಟೆಗಳು ($8,000 ರಿಂದ $30,000 ಕಾರ್ಮಿಕರು). ಇದು ಡಾಕ್ಯುಮೆಂಟ್ ಪ್ರೊಸೆಸಿಂಗ್ ಪೈಪ್ಲೈನ್, ಚಂಕಿಂಗ್ ಮತ್ತು ಎಂಬೆಡಿಂಗ್, ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಸೆಟಪ್, ರಿಟ್ರೀವಲ್ ಲಾಜಿಕ್, LLM ಏಕೀಕರಣ, ಮೌಲ್ಯಮಾಪನ ಚೌಕಟ್ಟು ಮತ್ತು ಮೇಲ್ವಿಚಾರಣೆಯನ್ನು ಒಳಗೊಂಡಿದೆ. ನಡೆಯುತ್ತಿರುವ ಮೂಲಸೌಕರ್ಯ ವೆಚ್ಚಗಳು ಸಣ್ಣ ನಿಯೋಜನೆಗಳಿಗಾಗಿ ತಿಂಗಳಿಗೆ $50 ರಿಂದ ಎಂಟರ್ಪ್ರೈಸ್ ಸ್ಕೇಲ್ಗಾಗಿ ತಿಂಗಳಿಗೆ $5,000 ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚಿನದಾಗಿರುತ್ತದೆ. ಹೆಚ್ಚಿನ ತಂಡಗಳು 4 ರಿಂದ 8 ವಾರಗಳಲ್ಲಿ ಉತ್ಪಾದನೆ-ಸಿದ್ಧ ಗುಣಮಟ್ಟವನ್ನು ತಲುಪುತ್ತವೆ.
Common Mistakes to Avoid
▾
- !LLM ಗೆ ಹಲವಾರು ಹಿಂಪಡೆದ ಭಾಗಗಳನ್ನು ರವಾನಿಸುವುದು:
- !ಬಜೆಟ್ ಮಾದರಿಯು ಸಾಕಾಗಿದಾಗ ಅತ್ಯಂತ ದುಬಾರಿ LLM ಅನ್ನು ಬಳಸುವುದು:
- !ಸಣ್ಣ ಕಾರ್ಪೊರಾಗಾಗಿ ವೆಕ್ಟರ್ ಡೇಟಾಬೇಸ್ ಅನ್ನು ಅತಿಯಾಗಿ ಒದಗಿಸುವುದು:
Pro Tip
ಹಿಂದಿನ ಪ್ರಶ್ನೆಗಳ ಎಂಬೆಡಿಂಗ್ಗಳು ಮತ್ತು ಅವುಗಳ ರಚಿತವಾದ ಉತ್ತರಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಲಾಕ್ಷಣಿಕ ಸಂಗ್ರಹವನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸಿ. ಹೊಸ ಪ್ರಶ್ನೆಯು ಕ್ಯಾಶ್ ಮಾಡಲಾದ ಪ್ರಶ್ನೆಗೆ ಶಬ್ದಾರ್ಥದ ರೀತಿಯಲ್ಲಿ (0.95 ಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಕೊಸೈನ್ ಹೋಲಿಕೆ) ಇದ್ದಾಗ, ಪೂರ್ಣ RAG ಪೈಪ್ಲೈನ್ ಅನ್ನು ರನ್ ಮಾಡುವ ಬದಲು ಕ್ಯಾಶ್ ಮಾಡಿದ ಉತ್ತರವನ್ನು ಹಿಂತಿರುಗಿ. ಇದೇ ರೀತಿಯ ಪ್ರಶ್ನೆಗಳನ್ನು ಪದೇ ಪದೇ ಕೇಳಲಾಗುವ ಗ್ರಾಹಕ ಬೆಂಬಲದಂತಹ ಪುನರಾವರ್ತಿತ ಪ್ರಶ್ನೆ ಮಾದರಿಗಳೊಂದಿಗೆ ಅಪ್ಲಿಕೇಶನ್ಗಳಿಗೆ ಇದು LLM ನಿರ್ಣಯದ ವೆಚ್ಚವನ್ನು 30 ರಿಂದ 50 ಪ್ರತಿಶತದಷ್ಟು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
Did you know?
ರಿಟ್ರೈವಲ್-ಆಗ್ಮೆಂಟೆಡ್ ಜನರೇಷನ್ ಪರಿಕಲ್ಪನೆಯನ್ನು ಫೇಸ್ಬುಕ್ ಎಐ ರಿಸರ್ಚ್ (ಈಗ ಮೆಟಾ ಎಐ) 2020 ರ ಪತ್ರಿಕೆಯಲ್ಲಿ ಪರಿಚಯಿಸಿದೆ. ಅಂದಿನಿಂದ, RAG ಅನ್ನು ನಿರ್ಮಿಸಲು LLM ಅಪ್ಲಿಕೇಶನ್ಗಳನ್ನು ನಿರ್ಮಿಸಲು ವ್ಯಾಪಕವಾಗಿ ಅಳವಡಿಸಿಕೊಂಡ ಮಾದರಿಯಾಗಿದೆ, ಇದನ್ನು ಅಂದಾಜು 80 ಪ್ರತಿಶತದಷ್ಟು ಎಂಟರ್ಪ್ರೈಸ್ AI ನಿಯೋಜನೆಗಳಿಂದ ಬಳಸಲಾಗಿದೆ. ಮರುಪಡೆಯುವಿಕೆ ಮತ್ತು ಉತ್ಪಾದನೆಯ ಸಂಯೋಜನೆಯು ಕಚ್ಚಾ LLM ಗಳೊಂದಿಗಿನ ಎರಡು ದೊಡ್ಡ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸುತ್ತದೆ: ಭ್ರಮೆ ಮತ್ತು ಸ್ವಾಮ್ಯದ ಅಥವಾ ಪ್ರಸ್ತುತ ಡೇಟಾಗೆ ಪ್ರವೇಶದ ಕೊರತೆ.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
References
ಸಾಪ್ತಾಹಿಕ ಗಣಿತ ಸಲಹೆಗಳನ್ನು ಪಡೆಯಿರಿ
ಪ್ರತಿ ವಾರ ಕ್ಯಾಲ್ಕುಲೇಟರ್ ಸಲಹೆಗಳನ್ನು ಪಡೆಯುವ 12,000+ ಚಂದಾದಾರರನ್ನು ಸೇರಿ.