Skip to content
Skip to main content
DigiCalcs

சிறப்பு

RAG Pipeline Cost Calculator

என்றால் என்ன RAG Pipeline Cost Calculator?

▾

RAG பைப்லைன் காஸ்ட் கால்குலேட்டர் நான்கு செலவு கூறுகளை இணைத்து மீட்டெடுப்பு-ஆக்மென்டட் ஜெனரேஷன் சிஸ்டத்தை இயக்குவதற்கான மொத்த மாதாந்திர செலவை மதிப்பிடுகிறது: உட்பொதித்தல் உருவாக்கம், வெக்டர் தரவுத்தள ஹோஸ்டிங், ஆவணம் மீட்டெடுப்பு வினவல்கள் மற்றும் பதில் உருவாக்கத்திற்கான LLM அனுமானம். RAG பைப்லைன்கள் உங்கள் தனியுரிம தரவுகளில் LLM மறுமொழிகளை பதில்களை உருவாக்கும் முன் தொடர்புடைய ஆவணங்களை மீட்டெடுக்கிறது, மாயத்தோற்றத்தை வியத்தகு முறையில் குறைக்கிறது மற்றும் டொமைன்-குறிப்பிட்ட பயன்பாடுகளுக்கான துல்லியத்தை மேம்படுத்துகிறது. பொறியியல் குழுக்கள் அறிவுத் தளங்கள், வாடிக்கையாளர் ஆதரவு அமைப்புகள், உள் தேடல் கருவிகள் மற்றும் குறிப்பிட்ட ஆவணங்கள் அல்லது தரவு பற்றிய கேள்விகளுக்கு பதிலளிக்க LLM தேவைப்படும் எந்தவொரு பயன்பாட்டிற்கும் இந்தக் கால்குலேட்டர் அவசியம். 100,000-ஆவண கார்பஸுடன் மாதத்திற்கு 10,000 வினவல்களை வழங்கும் ஒரு பொதுவான RAG பைப்லைன் கூறுகளின் தேர்வுகளைப் பொறுத்து மாதத்திற்கு $150 முதல் $500 வரை செலவாகும், இது ஒரு கட்டிடக்கலைக்கு முன் மாதிரி செலவுகளை முக்கியமானதாக ஆக்குகிறது. நான்கு விலை கூறுகள் மிகவும் வேறுபட்ட அளவிடுதல் பண்புகளைக் கொண்டுள்ளன. உட்பொதித்தல் என்பது முதன்மையாக ஒரு முறை செலவாகும், இது ஆவணப் புதுப்பிப்புகளுக்கு மட்டுமே திரும்பும். வெக்டர் தரவுத்தள ஹோஸ்டிங் என்பது கார்பஸ் அளவுடன் வளரும் நிலையான மாதாந்திர செலவாகும். மீட்டெடுப்பு வினவல் செலவுகள் வினவல் தொகுதியுடன் நேர்கோட்டில் அளவிடப்படுகிறது. மற்றும் LLM அனுமானம், பொதுவாக மொத்த செலவில் 60 முதல் 80 சதவிகிதம் உள்ள மிகப்பெரிய கூறு, வினவல் அளவு மற்றும் மாதிரிக்கு அனுப்பப்பட்ட மீட்டெடுக்கப்பட்ட சூழலின் அளவு ஆகிய இரண்டையும் கொண்டுள்ளது. இந்த இயக்கவியலைப் புரிந்துகொள்வது, குழுக்கள் மிகவும் தாக்கத்தை ஏற்படுத்தும் செலவு இயக்கிகளை மேம்படுத்த உதவுகிறது.

DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.

சூத்திரம்

▾
f(x)மொத்த மாதாந்திர RAG செலவு = உட்பொதித்தல் செலவு + வெக்டர் DB மாதாந்திர செலவு + (ஒரு மாதத்திற்கான வினவல்கள் x வினவல் ஒன்றுக்கு மீட்டெடுப்பு செலவு) + (ஒரு வினவலுக்கு ஒரு மாத வினாக்கள் x LLM விலை). 100K ஆவணங்களைக் கொண்ட அமைப்பிற்கு, 20K மாதாந்திர வினவல்கள், உரை-உட்பொதித்தல்-3-சிறிய, Pinecone மற்றும் GPT-4o ஆகியவற்றைப் பயன்படுத்தி: உட்பொதித்தல் = $1.00 (ஒரு முறை, பணமதிப்பு நீக்கப்பட்டது). திசையன் DB = $70/மா. மீட்டல் = அலட்சியம். LLM = 20,000 x (3,000 உள்ளீட்டு டோக்கன்கள் x $2.50/1M + 500 வெளியீடு டோக்கன்கள் x $10/1M) = $250.00. மொத்தம் = மாதத்திற்கு சுமார் $321.

மாறி விளக்கம்

▾
குறியீடுபெயர்அலகுவிவரிப்பு
Dஆவண கார்பஸ் அளவுdocumentsஉட்பொதித்தல் செலவு மற்றும் திசையன் சேமிப்பகத் தேவைகளை நிர்ணயிக்கும் திசையன் தரவுத்தளத்தில் சேமிக்கப்பட்ட உரை ஆவணங்கள் அல்லது துகள்களின் மொத்த எண்ணிக்கை.
T_chunkஒரு சங்குக்கு டோக்கன்கள்tokensஒரு ஆவணத் துண்டின் சராசரி டோக்கன் எண்ணிக்கை, பொதுவாக RAG அமைப்புகளில் உகந்த மீட்டெடுப்பு கிரானுலாரிட்டிக்கு 256 முதல் 512 டோக்கன்கள்.
Kஒரு வினவல் மூலம் பெறப்பட்ட துண்டுகள்chunksஒவ்வொரு பயனர் வினவலுக்கும் வெக்டர் தரவுத்தளத்திலிருந்து பெறப்பட்ட ஒத்த ஆவணத் துண்டுகளின் எண்ணிக்கை, பொதுவாக கேள்விகளின் சிக்கலான தன்மையைப் பொறுத்து 3 முதல் 8 வரை இருக்கும்.
Qமாதாந்திர வினவல் தொகுதிqueries per monthஒவ்வொரு மாதமும் RAG பைப்லைன் மூலம் செயலாக்கப்படும் பயனர் வினவல்களின் மொத்த எண்ணிக்கை, இது மீட்டெடுப்பு மற்றும் LLM அனுமான செலவுகள் இரண்டையும் இயக்குகிறது.
C_vdbவெக்டர் டிபி மாதாந்திர செலவுUSD per monthவெக்டார் தரவுத்தள சேவைக்கான நிலையான அல்லது பயன்பாட்டு அடிப்படையிலான மாதாந்திர ஹோஸ்டிங் செலவு, சர்வர்லெஸ்க்கு $10 முதல் $200 அல்லது அதற்கு மேல் அர்ப்பணிக்கப்பட்ட காய்களுக்கு.
C_llmஒரு வினவலுக்கு LLM செலவுUSD per queryமீட்டெடுக்கப்பட்ட சூழலைச் செயலாக்குவதற்கும் பதிலை உருவாக்குவதற்கும் மொழி மாதிரிக்கான அனுமானச் செலவு, பொதுவாக ஒரு வினவலுக்கு $0.005 முதல் $0.05 வரையிலான மிகப்பெரிய ஒற்றை விலை கூறு.

எப்படி RAG Pipeline Cost Calculator

▾
  1. 1உங்கள் ஆவண கார்பஸிற்கான உட்பொதிவு செலவைக் கணக்கிடுங்கள். ஆவணங்களின் மொத்த எண்ணிக்கை, பிரித்த பிறகு ஒரு துண்டின் சராசரி டோக்கன்கள் மற்றும் துண்டுகளுக்கு இடையில் ஏதேனும் ஒன்றுடன் ஒன்று இருப்பதைத் தீர்மானிக்கவும். Text-embedding-3-small ஐப் பயன்படுத்தி ஒரு மில்லியன் டோக்கன்களுக்கு $0.02, 100,000 ஆவணங்கள் ஒவ்வொன்றும் 400 டோக்கன்களில் 15 சதவிகிதம் ஒன்றுடன் ஒன்று சேர்த்து ஆரம்ப உட்பொதிப்பிற்கு $0.92 செலவாகும். புதிய அல்லது புதுப்பிக்கப்பட்ட ஆவணங்களுக்கு மட்டுமே அதிகரிக்கும் செலவுகளுடன், மாதக்கணக்கில் மாற்றியமைக்கப்பட்ட ஒரு முறை செலவாகும்.
  2. 2உங்கள் வெக்டர் தரவுத்தள ஹோஸ்டிங் செலவை மதிப்பிடவும். படிக்கும் அலகுகள், எழுதும் அலகுகள் மற்றும் சேமிப்பகத்தின் அடிப்படையில் பைன்கோன் சர்வர்லெஸ் கட்டணங்கள். 1536 பரிமாணங்களைக் கொண்ட 100,000 திசையன்களின் கார்பஸுக்கு சுமார் 600 MB சேமிப்பகம் தேவைப்படுகிறது. பைன்கோன் பாட் அடிப்படையிலான திட்டங்கள் ஒரு s1 பாட்க்கு மாதத்திற்கு $70 இல் தொடங்குகின்றன. வீவியேட் கிளவுட் சிறிய கிளஸ்டர்களுக்கு மாதத்திற்கு $25 இல் தொடங்குகிறது. மாதத்திற்கு $50 முதல் $150 வரை சுய-ஹோஸ்ட் செய்யப்பட்ட pgvector VM சிறிய வரிசைப்படுத்தல்களுக்கு மிகவும் சிக்கனமான விருப்பமாகும்.
  3. 3ஒரு வினவலுக்கான மீட்டெடுப்பு செலவைக் கணக்கிடுங்கள். நிர்வகிக்கப்படும் திசையன் தரவுத்தளங்களுக்கு, ஒவ்வொரு ஒற்றுமை தேடல் வினவலுக்கும் ஒரு சென்ட் பின்னங்கள் செலவாகும். பைன்கோன் சர்வர்லெஸ் ஒரு மில்லியன் ரீட் யூனிட்டுக்கு தோராயமாக $8 வசூலிக்கிறது, ஒவ்வொரு வினவலும் கோரப்பட்ட முடிவுகளின் எண்ணிக்கையைப் பொறுத்து 5 முதல் 10 ரீட் யூனிட்களை உட்கொள்ளும். சுய-ஹோஸ்ட் செய்யப்பட்ட தீர்வுகளுக்கு, வினவல் செலவு நிலையான ஹோஸ்டிங் செலவைத் தாண்டி பூஜ்ஜியமாக இருக்கும். மீட்டெடுப்பு செலவுகள் பொதுவாக RAG பைப்லைனின் மிகச்சிறிய கூறு ஆகும்.
  4. 4ஒரு வினவலுக்கான LLM அனுமானச் செலவைக் கணக்கிடுங்கள், இது பொதுவாக மேலாதிக்கச் செலவாகும். ஒவ்வொரு RAG வினவலும் பயனர் கேள்வி மற்றும் மீட்டெடுக்கப்பட்ட ஆவணத் துண்டுகளை உள்ளீட்டு டோக்கன்களாக அனுப்புகிறது, பின்னர் வெளியீட்டு டோக்கன்களாக பதிலை உருவாக்குகிறது. ஒவ்வொன்றும் 400 டோக்கன்கள் மற்றும் 200-டோக்கன் சிஸ்டம் ப்ராம்ட் மற்றும் 100-டோக்கன் பயனர் வினவல் ஆகியவற்றைக் கொண்ட 5 துண்டுகளை மீட்டெடுத்தால், மொத்த உள்ளீடு 2,300 டோக்கன்கள். GPT-4o இல் 500-டோக்கன் பதிலுடன், ஒவ்வொரு வினவலுக்கும் தோராயமாக $0.011 செலவாகும். 20,000 மாதாந்திர வினவல்களில், LLM மொத்தமாக $212 செலவாகும்.
  5. 5கார்பஸ் புதுப்பிப்புகளுக்கு மீண்டும் உட்பொதித்தல் செலவுகளைச் சேர்க்கவும். உங்கள் ஆவணங்களில் 5 சதவிகிதம் மாதந்தோறும் மாறினால், மீண்டும் உட்பொதிக்கும் செலவு ஆரம்ப உட்பொதிவு செலவில் 5 சதவிகிதம் ஆகும். 100,000-ஆவண கார்பஸுக்கு, இது மாதத்திற்கு சுமார் $0.05 சேர்க்கிறது, இது மிகக் குறைவானது. இருப்பினும், உட்பொதிவு மாடல்களை மேம்படுத்தும் போது முழு கார்பஸையும் மீண்டும் உட்பொதித்தால் (ஆண்டுதோறும் பரிந்துரைக்கப்படும்), முழு ஆரம்ப உட்பொதிப்புச் செலவை குறிப்பிட்ட காலச் செலவாகக் கணக்கிடுங்கள்.
  6. 6வளர்ச்சி மற்றும் செயல்பாட்டு மேல்நிலை காரணி. RAG பைப்லைன்களுக்கு மீட்டெடுப்பு தரம், துண்டிங் உத்தி சரிப்படுத்துதல் மற்றும் அவ்வப்போது மறு அட்டவணைப்படுத்துதல் ஆகியவற்றிற்கான கண்காணிப்பு தேவைப்படுகிறது. ஒரு உற்பத்தி RAG அமைப்பை பராமரிப்பதற்கான பொறியியல் நேரம் பொதுவாக ஒரு மணி நேரத்திற்கு $100 முதல் $200 வரை மாதத்திற்கு 5 முதல் 10 மணிநேரம் செலவாகும், இது $500 முதல் $2,000 வரை தொழிலாளர் செலவில் சேர்க்கிறது. நேரடி உள்கட்டமைப்பு செலவு இல்லை என்றாலும், இந்த செயல்பாட்டு மேல்நிலை உரிமை கணக்கீடுகளின் மொத்த செலவில் சேர்க்கப்பட வேண்டும்.
  7. 7ஒவ்வொரு கூறுகளையும் மொத்த செலவின் சதவீதமாகக் காட்டும் முழுமையான செலவுப் பிரிவை மதிப்பாய்வு செய்யவும். பெரும்பாலான RAG அமைப்புகளுக்கு, எல்எல்எம் அனுமானம் 60 முதல் 80 சதவீதம் வரை ஆதிக்கம் செலுத்துகிறது, வெக்டர் தரவுத்தள ஹோஸ்டிங் கணக்குகள் 15 முதல் 30 சதவீதம், மற்றும் உட்பொதித்தல் மற்றும் மீட்டெடுப்பு ஆகியவை 5 சதவீதத்திற்கு கீழ் பிரதிபலிக்கின்றன. இந்த விநியோகம் என்பது மாதிரித் தேர்வு, உடனடி சுருக்கம் அல்லது மீட்டெடுக்கப்பட்ட துண்டின் எண்ணிக்கையைக் குறைத்தல் ஆகியவற்றின் மூலம் LLM செலவுகளை மேம்படுத்துவது மொத்த செலவில் அதிக தாக்கத்தை ஏற்படுத்துகிறது.

தீர்க்கப்பட்ட எடுத்துக்காட்டுகள்

▾
எடுத்துக்காட்டு 1சிறு வணிக அறிவு அடிப்படை
கொடுக்கப்பட்டது:10000, 300, உரை-உட்பொதித்தல்-3-சிறியது ($0.02/1M), Pinecone Serverless, GPT-4o-mini, 5000, 4
முடிவு:மாதத்திற்கு $42.00

உட்பொதித்தல் செலவு ஒரு முறை $0.06 இல் மிகக் குறைவு. வெக்டர் டிபி சர்வர்லெஸ் இந்த அளவில் மாதத்திற்கு சுமார் $10 செலவாகும். GPT-4o-mini உடன் LLM செலவு மாதத்திற்கு தோராயமாக $32 (5,000 வினவல்கள் x 1,400 உள்ளீட்டு டோக்கன்கள் x $0.15/1M + 300 வெளியீடு x $0.60/1M). இது சிறு வணிகங்களுக்கான மலிவு விலை RAG அமைப்பாகும்.

எடுத்துக்காட்டு 2நிறுவன ஆவணத் தேடல்
கொடுக்கப்பட்டது:1000000, 500, உரை-உட்பொதித்தல்-3-பெரிய ($0.13/1M), Pinecone p2 பாட், க்ளாட் சோனட் 4, 50000, 6
முடிவு:மாதத்திற்கு $2,175.00

1M வெக்டர்களைக் கையாளும் p2 பாட்க்கு வெக்டர் DB மாதத்திற்கு $200 செலவாகும். LLM அனுமானம் மாதத்திற்கு $1,950 இல் ஆதிக்கம் செலுத்துகிறது: $3/1M இல் 3,200 உள்ளீட்டு டோக்கன்களுடன் (6 துகள்கள் x 500 + மேல்நிலை) 50,000 வினவல்கள் மற்றும் $15/1M இல் 600 வெளியீடு டோக்கன்கள். மாற்றியமைக்கப்பட்ட செலவை உட்பொதிப்பதன் மூலம் மாதத்திற்கு சுமார் $25 சேர்க்கிறது.

எடுத்துக்காட்டு 3சுய-ஹோஸ்ட் செய்யப்பட்ட கூறுகளுடன் கூடிய பட்ஜெட் RAG
கொடுக்கப்பட்டது:200000, 400, உரை-உட்பொதித்தல்-3-சிறியது ($0.02/1M), pgvector on $80/mo VM, GPT-4o-mini, 30000, 5
முடிவு:மாதத்திற்கு $182.00

சுய-ஹோஸ்ட் செய்யப்பட்ட pgvector மாதத்திற்கு $80 இல் நிர்வகிக்கப்படும் தரவுத்தள பிரீமியத்தைத் தவிர்க்கிறது. GPT-4o-mini $0.15/$0.60 இல் 30,000 வினவல்களுக்கு LLM செலவுகளை மாதத்திற்கு $99 ஆக வைத்திருக்கிறது. மாற்றியமைக்கப்பட்ட உட்பொதித்தல் செலவு மாதத்திற்கு $3 சேர்க்கிறது. இந்த கட்டிடக்கலை 90 சதவீத நிறுவன RAG தரத்தை மாதத்திற்கு $200க்கு கீழ் வழங்குகிறது.

நடைமுறை பயன்பாடுகள்

▾
🏗️

வாடிக்கையாளர் கேள்விகளுக்கு உடனடி துல்லியமான பதில்களை வழங்க வாடிக்கையாளர் ஆதரவு தளங்கள் தங்கள் உதவி ஆவணங்கள் மற்றும் கடந்த கால டிக்கெட் தீர்மானங்கள் மூலம் RAG அமைப்புகளை உருவாக்குகின்றன. GPT-4o-mini RAG பைப்லைன் மூலம் 100,000 மாதாந்திர ஆதரவு வினவல்களை வழங்கும் 50,000 உதவிக் கட்டுரைகளைக் கொண்ட SaaS நிறுவனம் மாதத்திற்கு சுமார் $400 செலவழிக்கிறது. இது 60 முதல் 70 சதவீத வினவல்களைத் தானாகக் கையாளுகிறது, 24/7 உடனடி பதில்களை வழங்கும் போது மனித முகவர் செலவில் மாதத்திற்கு $50,000 முதல் $80,000 வரை சேமிக்கிறது.

🔬

சட்ட ஆராய்ச்சி தளங்கள் மில்லியன் கணக்கான நீதிமன்ற கருத்துகள், சட்டங்கள் மற்றும் ஒழுங்குமுறைகளை உட்பொதித்து, இயற்கையான மொழி வினவல்கள் மூலம் தொடர்புடைய முன்னோடிகளைக் கண்டறிய வழக்கறிஞர்களுக்கு உதவுகின்றன. Claude Sonnet 4ஐ பகுப்பாய்வுக்காகவும், Pineconeஐ மீட்டெடுப்பதற்காகவும் 5 மில்லியன் ஆவணத் துண்டுகளைக் கொண்ட ஒரு சட்டப்பூர்வ AI தொடக்கமானது 20,000 சிக்கலான சட்டக் கேள்விகளுக்குச் சேவை செய்ய மாதத்திற்கு சுமார் $5,000 செலவழிக்கிறது. சட்டப்பூர்வ 30 முதல் 60 நிமிடங்கள் எடுக்கும் ஒவ்வொரு கேள்விக்கும் 10 வினாடிகளுக்குள் பதிலளிக்கப்படும்.

📊

சுகாதார நிறுவனங்கள் மருத்துவ வழிகாட்டுதல்கள், மருந்து தரவுத்தளங்கள் மற்றும் மருத்துவ இலக்கியங்கள் ஆகியவற்றின் மூலம் RAG அமைப்புகளை உருவாக்கி, மருத்துவர்களுக்கான ஆதார அடிப்படையிலான முடிவு ஆதரவை வழங்குகின்றன. 15,000 மாதாந்திர மருத்துவ வினவல்களுக்கு சேவை செய்யும் 2 மில்லியன் மருத்துவ ஆவணங்களைக் கொண்ட ஒரு மருத்துவமனை அமைப்பு மாதத்திற்கு சுமார் $1,200 செலவழிக்கிறது. RAG அமைப்பு ஒவ்வொரு பதிலிலும் குறிப்பிட்ட வழிகாட்டுதல் பிரிவுகள் மற்றும் ஆய்வுக் கட்டுரைகளை மேற்கோள்காட்டி, மருத்துவ அமைப்புகளில் தேவையான கண்டுபிடிப்பை வழங்குகிறது.

🏥

தொடர்புடைய தயாரிப்பு விவரக்குறிப்புகள், மதிப்புரைகள் மற்றும் ஒப்பீட்டுத் தரவை மீட்டெடுப்பதன் மூலம் தயாரிப்புகளைப் பற்றிய விரிவான கேள்விகளுக்கு பதிலளிக்கக்கூடிய தயாரிப்பு பரிந்துரை சாட்போட்களை இயக்குவதற்கு ஈ-காமர்ஸ் நிறுவனங்கள் RAG ஐப் பயன்படுத்துகின்றன. GPT-4o-mini RAG பைப்லைன் மூலம் 200,000 மாதாந்திர ஷாப்பர் வினவல்களை வழங்கும் 500,000 தயாரிப்பு பக்கங்களைக் கொண்ட ஒரு சில்லறை விற்பனையாளர் மாதத்திற்கு சுமார் $800 செலவிடுகிறார். இது வாடிக்கையாளர்களுக்கு சரியான தயாரிப்புகளை விரைவாகக் கண்டறிய உதவுவதன் மூலம் மாற்று விகிதங்களை 15 முதல் 25 சதவீதம் வரை அதிகரிக்கிறது.

சிறப்பு நிகழ்வுகள்

▾

நிகழ்நேர தரவு புதுப்பிப்புகளைக் கையாள வேண்டிய RAG அமைப்புகளுக்கு (செய்தி ஊட்டங்கள் போன்றவை,

நிகழ்நேர தரவு புதுப்பிப்புகளைக் கையாள வேண்டிய RAG அமைப்புகளுக்கு (செய்தி ஊட்டங்கள், பங்கு விலைகள் அல்லது நேரடி ஆவணங்கள் போன்றவை), பாரம்பரிய தொகுதி உட்பொதித்தல் மற்றும் அட்டவணைப்படுத்தல் அணுகுமுறை ஏற்றுக்கொள்ள முடியாத தாமதத்தை அறிமுகப்படுத்துகிறது. உருவாக்கிய சில நொடிகளில் ஆவணங்களை உட்பொதித்து அட்டவணைப்படுத்தும் ஸ்ட்ரீமிங் RAG கட்டமைப்புகளுக்கு எப்போதும்-உட்பொதித்தல் சேவைகள் மற்றும் வேகமான எழுதும் செயல்திறன் கொண்ட வெக்டர் தரவுத்தளங்கள் தேவை. பேட்ச் ப்ராசஸிங்குடன் ஒப்பிடும்போது இது உட்பொதித்தல் உள்கட்டமைப்பு செலவை 5 முதல் 10 மடங்கு வரை அதிகரிக்கலாம், ஏனெனில் நீங்கள் குறிப்பிட்ட காலத் தொகுதி வேலைகளுக்குப் பதிலாக தொடர்ச்சியான கணக்கீடுகளுக்கு பணம் செலுத்துகிறீர்கள்.

பல மாதிரி RAG அமைப்புகள், படங்கள், அட்டவணைகள் மற்றும் அவற்றைப் பெறலாம்

உரையுடன் கூடுதலாக படங்கள், அட்டவணைகள் மற்றும் வரைபடங்களை மீட்டெடுக்கும் மற்றும் பகுத்தறியும் மல்டி-மாடல் RAG அமைப்புகள் கணிசமாக அதிக செலவுகளை எதிர்கொள்கின்றன. ஆவணப் படங்களை உட்பொதிவுகளாக மாற்ற, ஒரு டோக்கனுக்கு உரை உட்பொதிப்புகளை விட 5 முதல் 20 மடங்கு அதிக விலை கொண்ட பார்வை மாதிரிகள் தேவை. உரை உட்பொதிப்புகளுடன் பட உட்பொதிப்புகளை சேமிப்பது திசையன் தரவுத்தள அளவை அதிகரிக்கிறது. மீட்டெடுக்கப்பட்ட படங்களை GPT-4o பார்வை போன்ற மல்டி-மாடல் எல்எல்எம்களுக்கு அனுப்புவது ஒரு படத்திற்கு 500 முதல் 2,000 டோக்கன்களைப் பயன்படுத்துகிறது. மல்டி-மாடல் RAG பைப்லைன் டெக்ஸ்ட்-மட்டும் சமமானதை விட 3 முதல் 5 மடங்கு அதிகமாக செலவாகும்.

ஹெல்த்கேர் மற்றும் ஃபைனான்ஸ் போன்ற மிகவும் ஒழுங்குபடுத்தப்பட்ட தொழில்களுக்கு, RAG பைப்லைன்கள் அவசியம்

ஹெல்த்கேர் மற்றும் ஃபைனான்ஸ் போன்ற மிகவும் ஒழுங்குபடுத்தப்பட்ட தொழில்களுக்கு, RAG பைப்லைன்களில் தணிக்கை பதிவு, அணுகல் கட்டுப்பாடுகள் மற்றும் உள்கட்டமைப்பு சிக்கலான தன்மை மற்றும் செலவை சேர்க்கும் தரவு வரிசை கண்காணிப்பு ஆகியவை இருக்க வேண்டும். வினவல் பதிவுகள், மீட்டெடுக்கப்பட்ட ஆவணங்கள் மற்றும் இணக்க நோக்கங்களுக்காக LLM பதில்களை சேமிப்பது கூடுதல் சேமிப்பக செலவில் மாதத்திற்கு $50 முதல் $200 வரை சேர்க்கலாம். தரவு வதிவிடத் தேவைகளைப் பூர்த்தி செய்வதற்காக முழு பைப்லைனையும் ஒரு தனியார் VPC அல்லது வளாகத்தில் உள்ள சூழலில் இயக்குவது, நிலையான கிளவுட் வரிசைப்படுத்தல்களுடன் ஒப்பிடும்போது உள்கட்டமைப்பு செலவுகளை 2 முதல் 3 மடங்கு வரை அதிகரிக்கும்.

RAG பைப்லைன் கூறுகளின் விலை வரம்புகள் (2025)

▾
கூறுபட்ஜெட் விருப்பம்நடுத்தர வரம்பு விருப்பம்நிறுவன விருப்பம்
உட்பொதித்தல் (100K ஆவணங்கள்)$0.06 (3-சிறியது)$0.92 (3-சிறிய + ஒன்றுடன் ஒன்று)$9.20 (3-பெரிய + ஒன்றுடன் ஒன்று)
திசையன் தரவுத்தளம்$0-50/மாதம் (pgvector)$70-100/மாதம் (Pinecone s1)$200-500/mo (Pinecone p2)
ஒரு கேள்விக்கு LLM$0.001 (GPT-4o-mini)$0.011 (GPT-4o)$0.025 (கிளாட் சோனட் 4)
மாதாந்திர (10 ஆயிரம் வினவல்கள்)$60-100$180-300$450-750
மாதாந்திர (100 ஆயிரம் வினவல்கள்)$150-350$1,200-1,800$2,800-4,500

அடிக்கடி கேட்கப்படும் கேள்விகள்

▾
Q

RAG பைப்லைனில் மிகப்பெரிய செலவு இயக்கி என்ன?

A

LLM அனுமானம் என்பது மேலாதிக்கச் செலவாகும், பொதுவாக மொத்த மாதாந்திர செலவில் 60 முதல் 80 சதவிகிதம் ஆகும். ஏனென்றால், ஒவ்வொரு வினவலும் ஆயிரக்கணக்கான மீட்டெடுக்கப்பட்ட சூழல் டோக்கன்கள் மற்றும் பயனர் வினவலை LLM க்கு அனுப்புகிறது. மிகவும் பயனுள்ள செலவு மேம்படுத்தல் உத்திகள் இந்தக் கூறுகளைக் குறிவைக்கின்றன: GPT-4o-mini போன்ற மலிவான மாடல்களைப் பயன்படுத்துதல், மீட்டெடுக்கப்பட்ட துகள்களின் எண்ணிக்கையைக் குறைத்தல், LLM க்கு அனுப்பும் முன் சூழலை சுருக்குதல் மற்றும் அடிக்கடி வினவல் முடிவுகளைத் தேக்குதல்.

Q

Pinecone, Weaviate மற்றும் pgvector ஆகியவற்றுக்கு இடையே நான் எப்படி தேர்வு செய்வது?

A

Pinecone அமைப்பதற்கும் அளவிடுவதற்கும் எளிதானது ஆனால் பெரிய வரிசைப்படுத்தல்களுக்கு மிகவும் விலை உயர்ந்தது. வீவியேட் தாராளமான இலவச அடுக்குடன் அம்சங்கள் மற்றும் செலவின் நல்ல சமநிலையை வழங்குகிறது. எந்தவொரு நிலையான தரவுத்தள சேவையகத்திலும் இயங்கும் PostgreSQL நிபுணத்துவம் கொண்ட குழுக்களுக்கு pgvector மலிவான விருப்பமாகும். 100,000 வெக்டர்களுக்கு கீழ் உள்ள கார்போராவிற்கு, $50 VM இல் pgvector பொதுவாக போதுமானது. 100,000 முதல் 10 மில்லியன் திசையன்களுக்கு, Pinecone serverless அல்லது Weaviate Cloud சிறந்த செயல்திறன்-செலவு விகிதங்களை வழங்குகிறது.

Q

ஒரு வினவலுக்கு எத்தனை துண்டுகளை நான் மீட்டெடுக்க வேண்டும்?

A

3 முதல் 5 துகள்களில் தொடங்கி விடையின் தரத்தை அளவிடவும். அதிக துகள்களை மீட்டெடுப்பது அதிக சூழலை வழங்குகிறது ஆனால் LLM உள்ளீடு டோக்கன்கள் மற்றும் விலையை அதிகரிக்கிறது. 5 முதல் 7 துகள்களுக்கு அப்பால், கூடுதல் சூழலில் அடிக்கடி தேவையற்ற அல்லது பொருத்தமற்ற தகவல்களைக் கொண்டிருக்கும், அவை மாதிரியைக் குழப்பலாம் மற்றும் பதில் தரத்தைக் குறைக்கலாம். 10 முதல் 20 விண்ணப்பதாரர்களின் ஆரம்ப மீட்டெடுப்பில் இருந்து மிகவும் பொருத்தமான 3 முதல் 5 துகள்களைத் தேர்ந்தெடுக்க மறு தரவரிசைப் படியை (கோஹேர் ரீராங்க் அல்லது கிராஸ்-என்கோடர் மாடல் போன்றவை) பயன்படுத்தவும்.

Q

RAG உற்பத்திக்கு இலவச வெக்டர் தரவுத்தளத்தைப் பயன்படுத்தலாமா?

A

ஆம், சிறிய மற்றும் நடுத்தர வரிசைப்படுத்தல்களுக்கு. ஏற்கனவே உள்ள PostgreSQL சர்வரில் இயங்கும் pgvector கூடுதல் செலவை சேர்க்கிறது. Croma மற்றும் FAISS ஆனது 1 மில்லியன் வெக்டர்களுக்கு கீழ் உள்ள கார்போராவிற்கு நினைவகத்தில் இயங்க முடியும். வீவியேட் கிளவுட் மேம்பாடு மற்றும் சிறிய உற்பத்தி பணிச்சுமைகளுக்கு ஏற்ற இலவச சாண்ட்பாக்ஸ் அடுக்கை வழங்குகிறது. இந்த விருப்பங்கள் 100,000 முதல் 500,000 வரையிலான வெக்டார்களுக்கு மிதமான வினவல் தொகுதிகளைக் கொண்டவையாக இருக்கும், இருப்பினும் அவை பணம் செலுத்திய நிர்வகிக்கப்படும் சேவைகளின் நம்பகத்தன்மை உத்தரவாதங்கள் இல்லாமல் இருக்கலாம்.

Q

சங்கிங் உத்தி RAG செலவுகளை எவ்வாறு பாதிக்கிறது?

A

சிறிய துகள்கள் (128 முதல் 256 டோக்கன்கள்) சேமிக்கப்பட்ட மற்றும் மீட்டெடுக்கப்பட்ட திசையன்களின் எண்ணிக்கையை அதிகரிக்கின்றன, ஆனால் மிகவும் துல்லியமான சூழலை வழங்குகின்றன. பெரிய துண்டுகள் (512 முதல் 1024 டோக்கன்கள்) திசையன் எண்ணிக்கையைக் குறைக்கின்றன, ஆனால் ஒவ்வொரு மீட்டெடுப்பிலும் பொருத்தமற்ற உள்ளடக்கம் இருக்கலாம். உகந்த துண்டின் அளவு உங்கள் ஆவண வகை மற்றும் வினவல் முறைகளைப் பொறுத்தது. பெரும்பாலான பயன்பாட்டு நிகழ்வுகளுக்கு, 50 முதல் 100 டோக்கன் ஒன்றுடன் ஒன்று 256 முதல் 512 வரையிலான டோக்கன்கள் மீட்டெடுப்பு துல்லியம் மற்றும் செலவுத் திறனின் சிறந்த சமநிலையை வழங்குகிறது.

Q

புதிதாக ஒரு RAG அமைப்பை உருவாக்குவதற்கான மொத்த செலவு என்ன?

A

ஒரு உற்பத்தி RAG அமைப்பிற்கான மேம்பாட்டுச் செலவு பொதுவாக 80 முதல் 200 பொறியியல் மணிநேரம் ஆகும் (உழைப்பில் $8,000 முதல் $30,000 வரை). ஆவண செயலாக்க பைப்லைன், துண்டித்தல் மற்றும் உட்பொதித்தல், திசையன் தரவுத்தள அமைப்பு, மீட்டெடுப்பு தர்க்கம், LLM ஒருங்கிணைப்பு, மதிப்பீட்டு கட்டமைப்பு மற்றும் கண்காணிப்பு ஆகியவை இதில் அடங்கும். தற்போதைய உள்கட்டமைப்பு செலவுகள் சிறிய வரிசைப்படுத்தல்களுக்கு மாதத்திற்கு $50 முதல் நிறுவன அளவில் $5,000 அல்லது அதற்கும் அதிகமாக இருக்கும். பெரும்பாலான அணிகள் 4 முதல் 8 வாரங்களுக்குள் உற்பத்திக்குத் தயாராகும் தரத்தை அடைகின்றன.

தவிர்க்க வேண்டிய பொதுவான தவறுகள்

▾
  • !LLM க்கு பல மீட்டெடுக்கப்பட்ட பகுதிகளை அனுப்புதல்:
  • !ஒரு பட்ஜெட் மாதிரி போதுமானதாக இருக்கும் போது மிகவும் விலையுயர்ந்த LLM ஐப் பயன்படுத்துதல்:
  • !சிறிய நிறுவனத்திற்கான வெக்டர் தரவுத்தளத்தை அதிகமாக வழங்குதல்:
💡

நிபுணர் குறிப்பு

முந்தைய வினவல்களின் உட்பொதிப்புகள் மற்றும் அவற்றால் உருவாக்கப்பட்ட பதில்களைச் சேமிக்கும் சொற்பொருள் தற்காலிக சேமிப்பை செயல்படுத்தவும். ஒரு புதிய வினவல், தற்காலிகச் சேமிப்பு வினவலுடன் (0.95க்கு மேல் உள்ள கொசைன் ஒற்றுமை) சொற்பொருளில் ஒத்ததாக இருக்கும் போது, ​​முழு RAG பைப்லைனை இயக்குவதற்குப் பதிலாக, தற்காலிக சேமிப்பில் உள்ள பதிலைத் திருப்பி அனுப்பவும். இதே கேள்விகள் அடிக்கடி கேட்கப்படும் வாடிக்கையாளர் ஆதரவு போன்ற, திரும்பத் திரும்ப வினவல் முறைகளைக் கொண்ட பயன்பாடுகளுக்கு LLM அனுமானச் செலவுகளை 30 முதல் 50 சதவீதம் வரை குறைக்கலாம்.

⭐

உங்களுக்கு தெரியுமா?

Retrieval-Augmented Generation என்ற கருத்து Facebook AI ஆராய்ச்சியால் (இப்போது Meta AI) 2020 பேப்பரில் அறிமுகப்படுத்தப்பட்டது. அப்போதிருந்து, RAG ஆனது எல்எல்எம் பயன்பாடுகளை உருவாக்குவதற்கான மிகவும் பரவலாக ஏற்றுக்கொள்ளப்பட்ட வடிவமாக மாறியுள்ளது, இது 80 சதவீத நிறுவன AI வரிசைப்படுத்தல்களால் பயன்படுத்தப்படுகிறது. மீட்டெடுப்பு மற்றும் உருவாக்கம் ஆகியவற்றின் கலவையானது மூல LLMகளில் உள்ள இரண்டு பெரிய சிக்கல்களைத் தீர்க்கிறது: மாயத்தோற்றம் மற்றும் தனியுரிம அல்லது தற்போதைய தரவுக்கான அணுகல் இல்லாமை.

Regional Guides

▾
North America▾
வட அமெரிக்க RAG வரிசைப்படுத்தல்கள் OpenAI, Anthropic மற்றும் முக்கிய கிளவுட் வழங்குநர் இறுதிப்புள்ளிகளுக்கு அருகாமையில் இருந்து பயனடைகின்றன, API அழைப்புகளுக்கு மிகக் குறைந்த தாமதத்தை வழங்குகிறது. Pinecone (San Francisco), Weaviate (ஆம்ஸ்டர்டாம்/US), மற்றும் பெரும்பாலான நிர்வகிக்கப்படும் வெக்டர் தரவுத்தள வழங்குநர்கள் US- அடிப்படையிலான உள்கட்டமைப்பைக் கொண்டுள்ளனர். எண்டர்பிரைஸ் வாடிக்கையாளர்கள் பெரும்பாலும் RAG பைப்லைன்களை முழுவதுமாக AWS us-east-1 அல்லது GCP us-central1 இல் இயக்கி, குறுக்கு பிராந்திய தரவு பரிமாற்ற செலவுகள் மற்றும் தாமதத்தை குறைக்கிறார்கள்.
Europe▾
ஐரோப்பிய RAG வரிசைப்படுத்தல்கள், ஆவண உட்பொதித்தல்கள் மற்றும் திசையன் தரவுத்தளம் ஐரோப்பிய ஒன்றிய எல்லைகளுக்குள் இருப்பதை உறுதி செய்வதன் மூலம் GDPR தரவு வதிவிடத்தை நிவர்த்தி செய்ய வேண்டும். EU பிராந்தியங்களில் Azure OpenAI, Amazon Bedrock eu-west-1 வழியாக Anthropic, மற்றும் Weaviate Cloud EU நிகழ்வுகள் இணக்கமான விருப்பங்களை வழங்குகின்றன. EU கிளவுட் VMகளில் சுய-ஹோஸ்ட் செய்யப்பட்ட pgvector ஆனது செலவு உணர்திறன் GDPR-இணக்கமான வரிசைப்படுத்தல்களுக்கு பிரபலமானது, இருப்பினும் நிர்வகிக்கப்பட்ட மாற்றுகளை விட அதிக செயல்பாட்டு நிபுணத்துவம் தேவைப்படுகிறது.
Asia-Pacific▾
ஆசியா-பசிபிக் பகுதியில் உள்ள RAG அமைப்புகளுக்கு CJK மொழிகளுக்கான பன்மொழி ஆதரவு தேவைப்படுகிறது. சீன, ஜப்பானிய மற்றும் கொரிய உரை ஆங்கிலத்தை விட ஒரு வார்த்தைக்கு அதிக டோக்கன்களாக மாற்றுகிறது, உட்பொதித்தல் மற்றும் LLM செலவுகள் 50 முதல் 100 சதவீதம் வரை அதிகரிக்கும். அலிபாபா கிளவுட் மற்றும் டென்சென்ட் கிளவுட் போன்ற உள்ளூர் கிளவுட் வழங்குநர்கள் சுய-ஹோஸ்ட் செய்யப்பட்ட RAG கூறுகளுக்கு US சமமானவற்றை விட 30 முதல் 50 சதவீதம் குறைந்த விலையில் GPU நிகழ்வுகளை வழங்குகிறார்கள்.
📖கடினத்தன்மை:மேம்பட்ட
Accuracy-checked
Reviewed October 2026
Our methodology

வாராந்திர கணித உதவிக்குறிப்புகளைப் பெறுங்கள்

ஒவ்வொரு வாரமும் கால்குலேட்டர் உதவிக்குறிப்புகளைப் பெறும் 12,000+ சந்தாதாரர்களுடன் சேரவும்.

🔒
100% இலவசம்
பதிவு தேவையில்லை
✓
துல்லியமான
சரிபார்க்கப்பட்ட சூத்திரங்கள்
⚡
உடனடி
தட்டச்சு செய்யும்போது முடிவுகள்
📱
மொபைல் தயார்
அனைத்து சாதனங்கள்

அமைப்புகள்