என்றால் என்ன RAG Pipeline Cost Calculator?
▾
RAG பைப்லைன் காஸ்ட் கால்குலேட்டர் நான்கு செலவு கூறுகளை இணைத்து மீட்டெடுப்பு-ஆக்மென்டட் ஜெனரேஷன் சிஸ்டத்தை இயக்குவதற்கான மொத்த மாதாந்திர செலவை மதிப்பிடுகிறது: உட்பொதித்தல் உருவாக்கம், வெக்டர் தரவுத்தள ஹோஸ்டிங், ஆவணம் மீட்டெடுப்பு வினவல்கள் மற்றும் பதில் உருவாக்கத்திற்கான LLM அனுமானம். RAG பைப்லைன்கள் உங்கள் தனியுரிம தரவுகளில் LLM மறுமொழிகளை பதில்களை உருவாக்கும் முன் தொடர்புடைய ஆவணங்களை மீட்டெடுக்கிறது, மாயத்தோற்றத்தை வியத்தகு முறையில் குறைக்கிறது மற்றும் டொமைன்-குறிப்பிட்ட பயன்பாடுகளுக்கான துல்லியத்தை மேம்படுத்துகிறது. பொறியியல் குழுக்கள் அறிவுத் தளங்கள், வாடிக்கையாளர் ஆதரவு அமைப்புகள், உள் தேடல் கருவிகள் மற்றும் குறிப்பிட்ட ஆவணங்கள் அல்லது தரவு பற்றிய கேள்விகளுக்கு பதிலளிக்க LLM தேவைப்படும் எந்தவொரு பயன்பாட்டிற்கும் இந்தக் கால்குலேட்டர் அவசியம். 100,000-ஆவண கார்பஸுடன் மாதத்திற்கு 10,000 வினவல்களை வழங்கும் ஒரு பொதுவான RAG பைப்லைன் கூறுகளின் தேர்வுகளைப் பொறுத்து மாதத்திற்கு $150 முதல் $500 வரை செலவாகும், இது ஒரு கட்டிடக்கலைக்கு முன் மாதிரி செலவுகளை முக்கியமானதாக ஆக்குகிறது. நான்கு விலை கூறுகள் மிகவும் வேறுபட்ட அளவிடுதல் பண்புகளைக் கொண்டுள்ளன. உட்பொதித்தல் என்பது முதன்மையாக ஒரு முறை செலவாகும், இது ஆவணப் புதுப்பிப்புகளுக்கு மட்டுமே திரும்பும். வெக்டர் தரவுத்தள ஹோஸ்டிங் என்பது கார்பஸ் அளவுடன் வளரும் நிலையான மாதாந்திர செலவாகும். மீட்டெடுப்பு வினவல் செலவுகள் வினவல் தொகுதியுடன் நேர்கோட்டில் அளவிடப்படுகிறது. மற்றும் LLM அனுமானம், பொதுவாக மொத்த செலவில் 60 முதல் 80 சதவிகிதம் உள்ள மிகப்பெரிய கூறு, வினவல் அளவு மற்றும் மாதிரிக்கு அனுப்பப்பட்ட மீட்டெடுக்கப்பட்ட சூழலின் அளவு ஆகிய இரண்டையும் கொண்டுள்ளது. இந்த இயக்கவியலைப் புரிந்துகொள்வது, குழுக்கள் மிகவும் தாக்கத்தை ஏற்படுத்தும் செலவு இயக்கிகளை மேம்படுத்த உதவுகிறது.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
சூத்திரம்
▾
மொத்த மாதாந்திர RAG செலவு = உட்பொதித்தல் செலவு + வெக்டர் DB மாதாந்திர செலவு + (ஒரு மாதத்திற்கான வினவல்கள் x வினவல் ஒன்றுக்கு மீட்டெடுப்பு செலவு) + (ஒரு வினவலுக்கு ஒரு மாத வினாக்கள் x LLM விலை). 100K ஆவணங்களைக் கொண்ட அமைப்பிற்கு, 20K மாதாந்திர வினவல்கள், உரை-உட்பொதித்தல்-3-சிறிய, Pinecone மற்றும் GPT-4o ஆகியவற்றைப் பயன்படுத்தி: உட்பொதித்தல் = $1.00 (ஒரு முறை, பணமதிப்பு நீக்கப்பட்டது). திசையன் DB = $70/மா. மீட்டல் = அலட்சியம். LLM = 20,000 x (3,000 உள்ளீட்டு டோக்கன்கள் x $2.50/1M + 500 வெளியீடு டோக்கன்கள் x $10/1M) = $250.00. மொத்தம் = மாதத்திற்கு சுமார் $321.மாறி விளக்கம்
▾
| குறியீடு | பெயர் | அலகு | விவரிப்பு |
|---|---|---|---|
| D | ஆவண கார்பஸ் அளவு | documents | உட்பொதித்தல் செலவு மற்றும் திசையன் சேமிப்பகத் தேவைகளை நிர்ணயிக்கும் திசையன் தரவுத்தளத்தில் சேமிக்கப்பட்ட உரை ஆவணங்கள் அல்லது துகள்களின் மொத்த எண்ணிக்கை. |
| T_chunk | ஒரு சங்குக்கு டோக்கன்கள் | tokens | ஒரு ஆவணத் துண்டின் சராசரி டோக்கன் எண்ணிக்கை, பொதுவாக RAG அமைப்புகளில் உகந்த மீட்டெடுப்பு கிரானுலாரிட்டிக்கு 256 முதல் 512 டோக்கன்கள். |
| K | ஒரு வினவல் மூலம் பெறப்பட்ட துண்டுகள் | chunks | ஒவ்வொரு பயனர் வினவலுக்கும் வெக்டர் தரவுத்தளத்திலிருந்து பெறப்பட்ட ஒத்த ஆவணத் துண்டுகளின் எண்ணிக்கை, பொதுவாக கேள்விகளின் சிக்கலான தன்மையைப் பொறுத்து 3 முதல் 8 வரை இருக்கும். |
| Q | மாதாந்திர வினவல் தொகுதி | queries per month | ஒவ்வொரு மாதமும் RAG பைப்லைன் மூலம் செயலாக்கப்படும் பயனர் வினவல்களின் மொத்த எண்ணிக்கை, இது மீட்டெடுப்பு மற்றும் LLM அனுமான செலவுகள் இரண்டையும் இயக்குகிறது. |
| C_vdb | வெக்டர் டிபி மாதாந்திர செலவு | USD per month | வெக்டார் தரவுத்தள சேவைக்கான நிலையான அல்லது பயன்பாட்டு அடிப்படையிலான மாதாந்திர ஹோஸ்டிங் செலவு, சர்வர்லெஸ்க்கு $10 முதல் $200 அல்லது அதற்கு மேல் அர்ப்பணிக்கப்பட்ட காய்களுக்கு. |
| C_llm | ஒரு வினவலுக்கு LLM செலவு | USD per query | மீட்டெடுக்கப்பட்ட சூழலைச் செயலாக்குவதற்கும் பதிலை உருவாக்குவதற்கும் மொழி மாதிரிக்கான அனுமானச் செலவு, பொதுவாக ஒரு வினவலுக்கு $0.005 முதல் $0.05 வரையிலான மிகப்பெரிய ஒற்றை விலை கூறு. |
எப்படி RAG Pipeline Cost Calculator
▾
- 1உங்கள் ஆவண கார்பஸிற்கான உட்பொதிவு செலவைக் கணக்கிடுங்கள். ஆவணங்களின் மொத்த எண்ணிக்கை, பிரித்த பிறகு ஒரு துண்டின் சராசரி டோக்கன்கள் மற்றும் துண்டுகளுக்கு இடையில் ஏதேனும் ஒன்றுடன் ஒன்று இருப்பதைத் தீர்மானிக்கவும். Text-embedding-3-small ஐப் பயன்படுத்தி ஒரு மில்லியன் டோக்கன்களுக்கு $0.02, 100,000 ஆவணங்கள் ஒவ்வொன்றும் 400 டோக்கன்களில் 15 சதவிகிதம் ஒன்றுடன் ஒன்று சேர்த்து ஆரம்ப உட்பொதிப்பிற்கு $0.92 செலவாகும். புதிய அல்லது புதுப்பிக்கப்பட்ட ஆவணங்களுக்கு மட்டுமே அதிகரிக்கும் செலவுகளுடன், மாதக்கணக்கில் மாற்றியமைக்கப்பட்ட ஒரு முறை செலவாகும்.
- 2உங்கள் வெக்டர் தரவுத்தள ஹோஸ்டிங் செலவை மதிப்பிடவும். படிக்கும் அலகுகள், எழுதும் அலகுகள் மற்றும் சேமிப்பகத்தின் அடிப்படையில் பைன்கோன் சர்வர்லெஸ் கட்டணங்கள். 1536 பரிமாணங்களைக் கொண்ட 100,000 திசையன்களின் கார்பஸுக்கு சுமார் 600 MB சேமிப்பகம் தேவைப்படுகிறது. பைன்கோன் பாட் அடிப்படையிலான திட்டங்கள் ஒரு s1 பாட்க்கு மாதத்திற்கு $70 இல் தொடங்குகின்றன. வீவியேட் கிளவுட் சிறிய கிளஸ்டர்களுக்கு மாதத்திற்கு $25 இல் தொடங்குகிறது. மாதத்திற்கு $50 முதல் $150 வரை சுய-ஹோஸ்ட் செய்யப்பட்ட pgvector VM சிறிய வரிசைப்படுத்தல்களுக்கு மிகவும் சிக்கனமான விருப்பமாகும்.
- 3ஒரு வினவலுக்கான மீட்டெடுப்பு செலவைக் கணக்கிடுங்கள். நிர்வகிக்கப்படும் திசையன் தரவுத்தளங்களுக்கு, ஒவ்வொரு ஒற்றுமை தேடல் வினவலுக்கும் ஒரு சென்ட் பின்னங்கள் செலவாகும். பைன்கோன் சர்வர்லெஸ் ஒரு மில்லியன் ரீட் யூனிட்டுக்கு தோராயமாக $8 வசூலிக்கிறது, ஒவ்வொரு வினவலும் கோரப்பட்ட முடிவுகளின் எண்ணிக்கையைப் பொறுத்து 5 முதல் 10 ரீட் யூனிட்களை உட்கொள்ளும். சுய-ஹோஸ்ட் செய்யப்பட்ட தீர்வுகளுக்கு, வினவல் செலவு நிலையான ஹோஸ்டிங் செலவைத் தாண்டி பூஜ்ஜியமாக இருக்கும். மீட்டெடுப்பு செலவுகள் பொதுவாக RAG பைப்லைனின் மிகச்சிறிய கூறு ஆகும்.
- 4ஒரு வினவலுக்கான LLM அனுமானச் செலவைக் கணக்கிடுங்கள், இது பொதுவாக மேலாதிக்கச் செலவாகும். ஒவ்வொரு RAG வினவலும் பயனர் கேள்வி மற்றும் மீட்டெடுக்கப்பட்ட ஆவணத் துண்டுகளை உள்ளீட்டு டோக்கன்களாக அனுப்புகிறது, பின்னர் வெளியீட்டு டோக்கன்களாக பதிலை உருவாக்குகிறது. ஒவ்வொன்றும் 400 டோக்கன்கள் மற்றும் 200-டோக்கன் சிஸ்டம் ப்ராம்ட் மற்றும் 100-டோக்கன் பயனர் வினவல் ஆகியவற்றைக் கொண்ட 5 துண்டுகளை மீட்டெடுத்தால், மொத்த உள்ளீடு 2,300 டோக்கன்கள். GPT-4o இல் 500-டோக்கன் பதிலுடன், ஒவ்வொரு வினவலுக்கும் தோராயமாக $0.011 செலவாகும். 20,000 மாதாந்திர வினவல்களில், LLM மொத்தமாக $212 செலவாகும்.
- 5கார்பஸ் புதுப்பிப்புகளுக்கு மீண்டும் உட்பொதித்தல் செலவுகளைச் சேர்க்கவும். உங்கள் ஆவணங்களில் 5 சதவிகிதம் மாதந்தோறும் மாறினால், மீண்டும் உட்பொதிக்கும் செலவு ஆரம்ப உட்பொதிவு செலவில் 5 சதவிகிதம் ஆகும். 100,000-ஆவண கார்பஸுக்கு, இது மாதத்திற்கு சுமார் $0.05 சேர்க்கிறது, இது மிகக் குறைவானது. இருப்பினும், உட்பொதிவு மாடல்களை மேம்படுத்தும் போது முழு கார்பஸையும் மீண்டும் உட்பொதித்தால் (ஆண்டுதோறும் பரிந்துரைக்கப்படும்), முழு ஆரம்ப உட்பொதிப்புச் செலவை குறிப்பிட்ட காலச் செலவாகக் கணக்கிடுங்கள்.
- 6வளர்ச்சி மற்றும் செயல்பாட்டு மேல்நிலை காரணி. RAG பைப்லைன்களுக்கு மீட்டெடுப்பு தரம், துண்டிங் உத்தி சரிப்படுத்துதல் மற்றும் அவ்வப்போது மறு அட்டவணைப்படுத்துதல் ஆகியவற்றிற்கான கண்காணிப்பு தேவைப்படுகிறது. ஒரு உற்பத்தி RAG அமைப்பை பராமரிப்பதற்கான பொறியியல் நேரம் பொதுவாக ஒரு மணி நேரத்திற்கு $100 முதல் $200 வரை மாதத்திற்கு 5 முதல் 10 மணிநேரம் செலவாகும், இது $500 முதல் $2,000 வரை தொழிலாளர் செலவில் சேர்க்கிறது. நேரடி உள்கட்டமைப்பு செலவு இல்லை என்றாலும், இந்த செயல்பாட்டு மேல்நிலை உரிமை கணக்கீடுகளின் மொத்த செலவில் சேர்க்கப்பட வேண்டும்.
- 7ஒவ்வொரு கூறுகளையும் மொத்த செலவின் சதவீதமாகக் காட்டும் முழுமையான செலவுப் பிரிவை மதிப்பாய்வு செய்யவும். பெரும்பாலான RAG அமைப்புகளுக்கு, எல்எல்எம் அனுமானம் 60 முதல் 80 சதவீதம் வரை ஆதிக்கம் செலுத்துகிறது, வெக்டர் தரவுத்தள ஹோஸ்டிங் கணக்குகள் 15 முதல் 30 சதவீதம், மற்றும் உட்பொதித்தல் மற்றும் மீட்டெடுப்பு ஆகியவை 5 சதவீதத்திற்கு கீழ் பிரதிபலிக்கின்றன. இந்த விநியோகம் என்பது மாதிரித் தேர்வு, உடனடி சுருக்கம் அல்லது மீட்டெடுக்கப்பட்ட துண்டின் எண்ணிக்கையைக் குறைத்தல் ஆகியவற்றின் மூலம் LLM செலவுகளை மேம்படுத்துவது மொத்த செலவில் அதிக தாக்கத்தை ஏற்படுத்துகிறது.
தீர்க்கப்பட்ட எடுத்துக்காட்டுகள்
▾
உட்பொதித்தல் செலவு ஒரு முறை $0.06 இல் மிகக் குறைவு. வெக்டர் டிபி சர்வர்லெஸ் இந்த அளவில் மாதத்திற்கு சுமார் $10 செலவாகும். GPT-4o-mini உடன் LLM செலவு மாதத்திற்கு தோராயமாக $32 (5,000 வினவல்கள் x 1,400 உள்ளீட்டு டோக்கன்கள் x $0.15/1M + 300 வெளியீடு x $0.60/1M). இது சிறு வணிகங்களுக்கான மலிவு விலை RAG அமைப்பாகும்.
1M வெக்டர்களைக் கையாளும் p2 பாட்க்கு வெக்டர் DB மாதத்திற்கு $200 செலவாகும். LLM அனுமானம் மாதத்திற்கு $1,950 இல் ஆதிக்கம் செலுத்துகிறது: $3/1M இல் 3,200 உள்ளீட்டு டோக்கன்களுடன் (6 துகள்கள் x 500 + மேல்நிலை) 50,000 வினவல்கள் மற்றும் $15/1M இல் 600 வெளியீடு டோக்கன்கள். மாற்றியமைக்கப்பட்ட செலவை உட்பொதிப்பதன் மூலம் மாதத்திற்கு சுமார் $25 சேர்க்கிறது.
சுய-ஹோஸ்ட் செய்யப்பட்ட pgvector மாதத்திற்கு $80 இல் நிர்வகிக்கப்படும் தரவுத்தள பிரீமியத்தைத் தவிர்க்கிறது. GPT-4o-mini $0.15/$0.60 இல் 30,000 வினவல்களுக்கு LLM செலவுகளை மாதத்திற்கு $99 ஆக வைத்திருக்கிறது. மாற்றியமைக்கப்பட்ட உட்பொதித்தல் செலவு மாதத்திற்கு $3 சேர்க்கிறது. இந்த கட்டிடக்கலை 90 சதவீத நிறுவன RAG தரத்தை மாதத்திற்கு $200க்கு கீழ் வழங்குகிறது.
நடைமுறை பயன்பாடுகள்
▾
வாடிக்கையாளர் கேள்விகளுக்கு உடனடி துல்லியமான பதில்களை வழங்க வாடிக்கையாளர் ஆதரவு தளங்கள் தங்கள் உதவி ஆவணங்கள் மற்றும் கடந்த கால டிக்கெட் தீர்மானங்கள் மூலம் RAG அமைப்புகளை உருவாக்குகின்றன. GPT-4o-mini RAG பைப்லைன் மூலம் 100,000 மாதாந்திர ஆதரவு வினவல்களை வழங்கும் 50,000 உதவிக் கட்டுரைகளைக் கொண்ட SaaS நிறுவனம் மாதத்திற்கு சுமார் $400 செலவழிக்கிறது. இது 60 முதல் 70 சதவீத வினவல்களைத் தானாகக் கையாளுகிறது, 24/7 உடனடி பதில்களை வழங்கும் போது மனித முகவர் செலவில் மாதத்திற்கு $50,000 முதல் $80,000 வரை சேமிக்கிறது.
சட்ட ஆராய்ச்சி தளங்கள் மில்லியன் கணக்கான நீதிமன்ற கருத்துகள், சட்டங்கள் மற்றும் ஒழுங்குமுறைகளை உட்பொதித்து, இயற்கையான மொழி வினவல்கள் மூலம் தொடர்புடைய முன்னோடிகளைக் கண்டறிய வழக்கறிஞர்களுக்கு உதவுகின்றன. Claude Sonnet 4ஐ பகுப்பாய்வுக்காகவும், Pineconeஐ மீட்டெடுப்பதற்காகவும் 5 மில்லியன் ஆவணத் துண்டுகளைக் கொண்ட ஒரு சட்டப்பூர்வ AI தொடக்கமானது 20,000 சிக்கலான சட்டக் கேள்விகளுக்குச் சேவை செய்ய மாதத்திற்கு சுமார் $5,000 செலவழிக்கிறது. சட்டப்பூர்வ 30 முதல் 60 நிமிடங்கள் எடுக்கும் ஒவ்வொரு கேள்விக்கும் 10 வினாடிகளுக்குள் பதிலளிக்கப்படும்.
சுகாதார நிறுவனங்கள் மருத்துவ வழிகாட்டுதல்கள், மருந்து தரவுத்தளங்கள் மற்றும் மருத்துவ இலக்கியங்கள் ஆகியவற்றின் மூலம் RAG அமைப்புகளை உருவாக்கி, மருத்துவர்களுக்கான ஆதார அடிப்படையிலான முடிவு ஆதரவை வழங்குகின்றன. 15,000 மாதாந்திர மருத்துவ வினவல்களுக்கு சேவை செய்யும் 2 மில்லியன் மருத்துவ ஆவணங்களைக் கொண்ட ஒரு மருத்துவமனை அமைப்பு மாதத்திற்கு சுமார் $1,200 செலவழிக்கிறது. RAG அமைப்பு ஒவ்வொரு பதிலிலும் குறிப்பிட்ட வழிகாட்டுதல் பிரிவுகள் மற்றும் ஆய்வுக் கட்டுரைகளை மேற்கோள்காட்டி, மருத்துவ அமைப்புகளில் தேவையான கண்டுபிடிப்பை வழங்குகிறது.
தொடர்புடைய தயாரிப்பு விவரக்குறிப்புகள், மதிப்புரைகள் மற்றும் ஒப்பீட்டுத் தரவை மீட்டெடுப்பதன் மூலம் தயாரிப்புகளைப் பற்றிய விரிவான கேள்விகளுக்கு பதிலளிக்கக்கூடிய தயாரிப்பு பரிந்துரை சாட்போட்களை இயக்குவதற்கு ஈ-காமர்ஸ் நிறுவனங்கள் RAG ஐப் பயன்படுத்துகின்றன. GPT-4o-mini RAG பைப்லைன் மூலம் 200,000 மாதாந்திர ஷாப்பர் வினவல்களை வழங்கும் 500,000 தயாரிப்பு பக்கங்களைக் கொண்ட ஒரு சில்லறை விற்பனையாளர் மாதத்திற்கு சுமார் $800 செலவிடுகிறார். இது வாடிக்கையாளர்களுக்கு சரியான தயாரிப்புகளை விரைவாகக் கண்டறிய உதவுவதன் மூலம் மாற்று விகிதங்களை 15 முதல் 25 சதவீதம் வரை அதிகரிக்கிறது.
சிறப்பு நிகழ்வுகள்
▾
நிகழ்நேர தரவு புதுப்பிப்புகளைக் கையாள வேண்டிய RAG அமைப்புகளுக்கு (செய்தி ஊட்டங்கள் போன்றவை,
நிகழ்நேர தரவு புதுப்பிப்புகளைக் கையாள வேண்டிய RAG அமைப்புகளுக்கு (செய்தி ஊட்டங்கள், பங்கு விலைகள் அல்லது நேரடி ஆவணங்கள் போன்றவை), பாரம்பரிய தொகுதி உட்பொதித்தல் மற்றும் அட்டவணைப்படுத்தல் அணுகுமுறை ஏற்றுக்கொள்ள முடியாத தாமதத்தை அறிமுகப்படுத்துகிறது. உருவாக்கிய சில நொடிகளில் ஆவணங்களை உட்பொதித்து அட்டவணைப்படுத்தும் ஸ்ட்ரீமிங் RAG கட்டமைப்புகளுக்கு எப்போதும்-உட்பொதித்தல் சேவைகள் மற்றும் வேகமான எழுதும் செயல்திறன் கொண்ட வெக்டர் தரவுத்தளங்கள் தேவை. பேட்ச் ப்ராசஸிங்குடன் ஒப்பிடும்போது இது உட்பொதித்தல் உள்கட்டமைப்பு செலவை 5 முதல் 10 மடங்கு வரை அதிகரிக்கலாம், ஏனெனில் நீங்கள் குறிப்பிட்ட காலத் தொகுதி வேலைகளுக்குப் பதிலாக தொடர்ச்சியான கணக்கீடுகளுக்கு பணம் செலுத்துகிறீர்கள்.
பல மாதிரி RAG அமைப்புகள், படங்கள், அட்டவணைகள் மற்றும் அவற்றைப் பெறலாம்
உரையுடன் கூடுதலாக படங்கள், அட்டவணைகள் மற்றும் வரைபடங்களை மீட்டெடுக்கும் மற்றும் பகுத்தறியும் மல்டி-மாடல் RAG அமைப்புகள் கணிசமாக அதிக செலவுகளை எதிர்கொள்கின்றன. ஆவணப் படங்களை உட்பொதிவுகளாக மாற்ற, ஒரு டோக்கனுக்கு உரை உட்பொதிப்புகளை விட 5 முதல் 20 மடங்கு அதிக விலை கொண்ட பார்வை மாதிரிகள் தேவை. உரை உட்பொதிப்புகளுடன் பட உட்பொதிப்புகளை சேமிப்பது திசையன் தரவுத்தள அளவை அதிகரிக்கிறது. மீட்டெடுக்கப்பட்ட படங்களை GPT-4o பார்வை போன்ற மல்டி-மாடல் எல்எல்எம்களுக்கு அனுப்புவது ஒரு படத்திற்கு 500 முதல் 2,000 டோக்கன்களைப் பயன்படுத்துகிறது. மல்டி-மாடல் RAG பைப்லைன் டெக்ஸ்ட்-மட்டும் சமமானதை விட 3 முதல் 5 மடங்கு அதிகமாக செலவாகும்.
ஹெல்த்கேர் மற்றும் ஃபைனான்ஸ் போன்ற மிகவும் ஒழுங்குபடுத்தப்பட்ட தொழில்களுக்கு, RAG பைப்லைன்கள் அவசியம்
ஹெல்த்கேர் மற்றும் ஃபைனான்ஸ் போன்ற மிகவும் ஒழுங்குபடுத்தப்பட்ட தொழில்களுக்கு, RAG பைப்லைன்களில் தணிக்கை பதிவு, அணுகல் கட்டுப்பாடுகள் மற்றும் உள்கட்டமைப்பு சிக்கலான தன்மை மற்றும் செலவை சேர்க்கும் தரவு வரிசை கண்காணிப்பு ஆகியவை இருக்க வேண்டும். வினவல் பதிவுகள், மீட்டெடுக்கப்பட்ட ஆவணங்கள் மற்றும் இணக்க நோக்கங்களுக்காக LLM பதில்களை சேமிப்பது கூடுதல் சேமிப்பக செலவில் மாதத்திற்கு $50 முதல் $200 வரை சேர்க்கலாம். தரவு வதிவிடத் தேவைகளைப் பூர்த்தி செய்வதற்காக முழு பைப்லைனையும் ஒரு தனியார் VPC அல்லது வளாகத்தில் உள்ள சூழலில் இயக்குவது, நிலையான கிளவுட் வரிசைப்படுத்தல்களுடன் ஒப்பிடும்போது உள்கட்டமைப்பு செலவுகளை 2 முதல் 3 மடங்கு வரை அதிகரிக்கும்.
RAG பைப்லைன் கூறுகளின் விலை வரம்புகள் (2025)
▾
| கூறு | பட்ஜெட் விருப்பம் | நடுத்தர வரம்பு விருப்பம் | நிறுவன விருப்பம் |
|---|---|---|---|
| உட்பொதித்தல் (100K ஆவணங்கள்) | $0.06 (3-சிறியது) | $0.92 (3-சிறிய + ஒன்றுடன் ஒன்று) | $9.20 (3-பெரிய + ஒன்றுடன் ஒன்று) |
| திசையன் தரவுத்தளம் | $0-50/மாதம் (pgvector) | $70-100/மாதம் (Pinecone s1) | $200-500/mo (Pinecone p2) |
| ஒரு கேள்விக்கு LLM | $0.001 (GPT-4o-mini) | $0.011 (GPT-4o) | $0.025 (கிளாட் சோனட் 4) |
| மாதாந்திர (10 ஆயிரம் வினவல்கள்) | $60-100 | $180-300 | $450-750 |
| மாதாந்திர (100 ஆயிரம் வினவல்கள்) | $150-350 | $1,200-1,800 | $2,800-4,500 |
அடிக்கடி கேட்கப்படும் கேள்விகள்
▾
RAG பைப்லைனில் மிகப்பெரிய செலவு இயக்கி என்ன?
LLM அனுமானம் என்பது மேலாதிக்கச் செலவாகும், பொதுவாக மொத்த மாதாந்திர செலவில் 60 முதல் 80 சதவிகிதம் ஆகும். ஏனென்றால், ஒவ்வொரு வினவலும் ஆயிரக்கணக்கான மீட்டெடுக்கப்பட்ட சூழல் டோக்கன்கள் மற்றும் பயனர் வினவலை LLM க்கு அனுப்புகிறது. மிகவும் பயனுள்ள செலவு மேம்படுத்தல் உத்திகள் இந்தக் கூறுகளைக் குறிவைக்கின்றன: GPT-4o-mini போன்ற மலிவான மாடல்களைப் பயன்படுத்துதல், மீட்டெடுக்கப்பட்ட துகள்களின் எண்ணிக்கையைக் குறைத்தல், LLM க்கு அனுப்பும் முன் சூழலை சுருக்குதல் மற்றும் அடிக்கடி வினவல் முடிவுகளைத் தேக்குதல்.
Pinecone, Weaviate மற்றும் pgvector ஆகியவற்றுக்கு இடையே நான் எப்படி தேர்வு செய்வது?
Pinecone அமைப்பதற்கும் அளவிடுவதற்கும் எளிதானது ஆனால் பெரிய வரிசைப்படுத்தல்களுக்கு மிகவும் விலை உயர்ந்தது. வீவியேட் தாராளமான இலவச அடுக்குடன் அம்சங்கள் மற்றும் செலவின் நல்ல சமநிலையை வழங்குகிறது. எந்தவொரு நிலையான தரவுத்தள சேவையகத்திலும் இயங்கும் PostgreSQL நிபுணத்துவம் கொண்ட குழுக்களுக்கு pgvector மலிவான விருப்பமாகும். 100,000 வெக்டர்களுக்கு கீழ் உள்ள கார்போராவிற்கு, $50 VM இல் pgvector பொதுவாக போதுமானது. 100,000 முதல் 10 மில்லியன் திசையன்களுக்கு, Pinecone serverless அல்லது Weaviate Cloud சிறந்த செயல்திறன்-செலவு விகிதங்களை வழங்குகிறது.
ஒரு வினவலுக்கு எத்தனை துண்டுகளை நான் மீட்டெடுக்க வேண்டும்?
3 முதல் 5 துகள்களில் தொடங்கி விடையின் தரத்தை அளவிடவும். அதிக துகள்களை மீட்டெடுப்பது அதிக சூழலை வழங்குகிறது ஆனால் LLM உள்ளீடு டோக்கன்கள் மற்றும் விலையை அதிகரிக்கிறது. 5 முதல் 7 துகள்களுக்கு அப்பால், கூடுதல் சூழலில் அடிக்கடி தேவையற்ற அல்லது பொருத்தமற்ற தகவல்களைக் கொண்டிருக்கும், அவை மாதிரியைக் குழப்பலாம் மற்றும் பதில் தரத்தைக் குறைக்கலாம். 10 முதல் 20 விண்ணப்பதாரர்களின் ஆரம்ப மீட்டெடுப்பில் இருந்து மிகவும் பொருத்தமான 3 முதல் 5 துகள்களைத் தேர்ந்தெடுக்க மறு தரவரிசைப் படியை (கோஹேர் ரீராங்க் அல்லது கிராஸ்-என்கோடர் மாடல் போன்றவை) பயன்படுத்தவும்.
RAG உற்பத்திக்கு இலவச வெக்டர் தரவுத்தளத்தைப் பயன்படுத்தலாமா?
ஆம், சிறிய மற்றும் நடுத்தர வரிசைப்படுத்தல்களுக்கு. ஏற்கனவே உள்ள PostgreSQL சர்வரில் இயங்கும் pgvector கூடுதல் செலவை சேர்க்கிறது. Croma மற்றும் FAISS ஆனது 1 மில்லியன் வெக்டர்களுக்கு கீழ் உள்ள கார்போராவிற்கு நினைவகத்தில் இயங்க முடியும். வீவியேட் கிளவுட் மேம்பாடு மற்றும் சிறிய உற்பத்தி பணிச்சுமைகளுக்கு ஏற்ற இலவச சாண்ட்பாக்ஸ் அடுக்கை வழங்குகிறது. இந்த விருப்பங்கள் 100,000 முதல் 500,000 வரையிலான வெக்டார்களுக்கு மிதமான வினவல் தொகுதிகளைக் கொண்டவையாக இருக்கும், இருப்பினும் அவை பணம் செலுத்திய நிர்வகிக்கப்படும் சேவைகளின் நம்பகத்தன்மை உத்தரவாதங்கள் இல்லாமல் இருக்கலாம்.
சங்கிங் உத்தி RAG செலவுகளை எவ்வாறு பாதிக்கிறது?
சிறிய துகள்கள் (128 முதல் 256 டோக்கன்கள்) சேமிக்கப்பட்ட மற்றும் மீட்டெடுக்கப்பட்ட திசையன்களின் எண்ணிக்கையை அதிகரிக்கின்றன, ஆனால் மிகவும் துல்லியமான சூழலை வழங்குகின்றன. பெரிய துண்டுகள் (512 முதல் 1024 டோக்கன்கள்) திசையன் எண்ணிக்கையைக் குறைக்கின்றன, ஆனால் ஒவ்வொரு மீட்டெடுப்பிலும் பொருத்தமற்ற உள்ளடக்கம் இருக்கலாம். உகந்த துண்டின் அளவு உங்கள் ஆவண வகை மற்றும் வினவல் முறைகளைப் பொறுத்தது. பெரும்பாலான பயன்பாட்டு நிகழ்வுகளுக்கு, 50 முதல் 100 டோக்கன் ஒன்றுடன் ஒன்று 256 முதல் 512 வரையிலான டோக்கன்கள் மீட்டெடுப்பு துல்லியம் மற்றும் செலவுத் திறனின் சிறந்த சமநிலையை வழங்குகிறது.
புதிதாக ஒரு RAG அமைப்பை உருவாக்குவதற்கான மொத்த செலவு என்ன?
ஒரு உற்பத்தி RAG அமைப்பிற்கான மேம்பாட்டுச் செலவு பொதுவாக 80 முதல் 200 பொறியியல் மணிநேரம் ஆகும் (உழைப்பில் $8,000 முதல் $30,000 வரை). ஆவண செயலாக்க பைப்லைன், துண்டித்தல் மற்றும் உட்பொதித்தல், திசையன் தரவுத்தள அமைப்பு, மீட்டெடுப்பு தர்க்கம், LLM ஒருங்கிணைப்பு, மதிப்பீட்டு கட்டமைப்பு மற்றும் கண்காணிப்பு ஆகியவை இதில் அடங்கும். தற்போதைய உள்கட்டமைப்பு செலவுகள் சிறிய வரிசைப்படுத்தல்களுக்கு மாதத்திற்கு $50 முதல் நிறுவன அளவில் $5,000 அல்லது அதற்கும் அதிகமாக இருக்கும். பெரும்பாலான அணிகள் 4 முதல் 8 வாரங்களுக்குள் உற்பத்திக்குத் தயாராகும் தரத்தை அடைகின்றன.
தவிர்க்க வேண்டிய பொதுவான தவறுகள்
▾
- !LLM க்கு பல மீட்டெடுக்கப்பட்ட பகுதிகளை அனுப்புதல்:
- !ஒரு பட்ஜெட் மாதிரி போதுமானதாக இருக்கும் போது மிகவும் விலையுயர்ந்த LLM ஐப் பயன்படுத்துதல்:
- !சிறிய நிறுவனத்திற்கான வெக்டர் தரவுத்தளத்தை அதிகமாக வழங்குதல்:
நிபுணர் குறிப்பு
முந்தைய வினவல்களின் உட்பொதிப்புகள் மற்றும் அவற்றால் உருவாக்கப்பட்ட பதில்களைச் சேமிக்கும் சொற்பொருள் தற்காலிக சேமிப்பை செயல்படுத்தவும். ஒரு புதிய வினவல், தற்காலிகச் சேமிப்பு வினவலுடன் (0.95க்கு மேல் உள்ள கொசைன் ஒற்றுமை) சொற்பொருளில் ஒத்ததாக இருக்கும் போது, முழு RAG பைப்லைனை இயக்குவதற்குப் பதிலாக, தற்காலிக சேமிப்பில் உள்ள பதிலைத் திருப்பி அனுப்பவும். இதே கேள்விகள் அடிக்கடி கேட்கப்படும் வாடிக்கையாளர் ஆதரவு போன்ற, திரும்பத் திரும்ப வினவல் முறைகளைக் கொண்ட பயன்பாடுகளுக்கு LLM அனுமானச் செலவுகளை 30 முதல் 50 சதவீதம் வரை குறைக்கலாம்.
உங்களுக்கு தெரியுமா?
Retrieval-Augmented Generation என்ற கருத்து Facebook AI ஆராய்ச்சியால் (இப்போது Meta AI) 2020 பேப்பரில் அறிமுகப்படுத்தப்பட்டது. அப்போதிருந்து, RAG ஆனது எல்எல்எம் பயன்பாடுகளை உருவாக்குவதற்கான மிகவும் பரவலாக ஏற்றுக்கொள்ளப்பட்ட வடிவமாக மாறியுள்ளது, இது 80 சதவீத நிறுவன AI வரிசைப்படுத்தல்களால் பயன்படுத்தப்படுகிறது. மீட்டெடுப்பு மற்றும் உருவாக்கம் ஆகியவற்றின் கலவையானது மூல LLMகளில் உள்ள இரண்டு பெரிய சிக்கல்களைத் தீர்க்கிறது: மாயத்தோற்றம் மற்றும் தனியுரிம அல்லது தற்போதைய தரவுக்கான அணுகல் இல்லாமை.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
குறிப்புகள்
வாராந்திர கணித உதவிக்குறிப்புகளைப் பெறுங்கள்
ஒவ்வொரு வாரமும் கால்குலேட்டர் உதவிக்குறிப்புகளைப் பெறும் 12,000+ சந்தாதாரர்களுடன் சேரவும்.