কী RAG Pipeline Cost Calculator?
▾
RAG পাইপলাইন কস্ট ক্যালকুলেটর চারটি খরচ উপাদান একত্রিত করে একটি পুনরুদ্ধার-অগমেন্টেড জেনারেশন সিস্টেম চালানোর মোট মাসিক খরচ অনুমান করে: এমবেডিং জেনারেশন, ভেক্টর ডাটাবেস হোস্টিং, ডকুমেন্ট পুনরুদ্ধার ক্যোয়ারী এবং রেসপন্স জেনারেশনের জন্য এলএলএম ইনফারেন্স। RAG পাইপলাইনগুলি উত্তর তৈরি করার আগে প্রাসঙ্গিক নথিগুলি পুনরুদ্ধার করে, নাটকীয়ভাবে হ্যালুসিনেশন হ্রাস করে এবং ডোমেন-নির্দিষ্ট অ্যাপ্লিকেশনগুলির জন্য নির্ভুলতা উন্নত করে আপনার মালিকানাধীন ডেটাতে এলএলএম প্রতিক্রিয়াগুলিকে গ্রাউন্ড করে। এই ক্যালকুলেটরটি ইঞ্জিনিয়ারিং টিমের জন্য প্রয়োজনীয় জ্ঞানের ভিত্তি, গ্রাহক সহায়তা সিস্টেম, অভ্যন্তরীণ অনুসন্ধান সরঞ্জাম এবং যেকোন অ্যাপ্লিকেশনের জন্য নির্দিষ্ট নথি বা ডেটা সম্পর্কে প্রশ্নের উত্তর দেওয়ার জন্য একটি LLM প্রয়োজন। একটি 100,000-ডকুমেন্ট কর্পাস সহ একটি সাধারণ RAG পাইপলাইন প্রতি মাসে 10,000 প্রশ্ন পরিবেশন করে কম্পোনেন্ট পছন্দের উপর নির্ভর করে প্রতি মাসে $150 থেকে $500 খরচ হতে পারে, যা একটি আর্কিটেকচারে প্রতিশ্রুতিবদ্ধ হওয়ার আগে মডেল খরচের জন্য এটিকে গুরুত্বপূর্ণ করে তোলে। চারটি খরচ উপাদানের খুব ভিন্ন স্কেলিং বৈশিষ্ট্য আছে। এম্বেডিং প্রাথমিকভাবে একটি এককালীন খরচ যা শুধুমাত্র ডকুমেন্ট আপডেটের জন্য পুনরাবৃত্তি হয়। ভেক্টর ডাটাবেস হোস্টিং হল একটি নির্দিষ্ট মাসিক খরচ যা কর্পাস আকারের সাথে বৃদ্ধি পায়। পুনরুদ্ধার ক্যোয়ারী ক্যোয়ারী ভলিউমের সাথে রৈখিকভাবে স্কেল করে। এবং LLM অনুমান, সাধারণত মোট খরচের 60 থেকে 80 শতাংশের মধ্যে সবচেয়ে বড় উপাদান, উভয় কোয়েরি ভলিউম এবং মডেলটিতে পুনরুদ্ধার করা প্রসঙ্গের পরিমাণ উভয়ের সাথে স্কেল। এই গতিবিদ্যা বোঝা দলগুলিকে সবচেয়ে প্রভাবশালী খরচ চালকদের অপ্টিমাইজ করতে সাহায্য করে৷
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
সূত্র
▾
মোট মাসিক RAG খরচ = এম্বেডিং খরচ + ভেক্টর DB মাসিক খরচ + (প্রতি মাসে প্রশ্ন x পুনরুদ্ধার খরচ প্রতি প্রশ্ন) + (প্রতি মাসে প্রশ্ন x LLM খরচ প্রতি প্রশ্ন)। টেক্সট-এমবেডিং-3-small, Pinecone, এবং GPT-4o ব্যবহার করে 100K নথি, 20K মাসিক ক্যোয়ারী সহ একটি সিস্টেমের জন্য: এমবেডিং = $1.00 (একবার, অ্যামোর্টাইজড)। ভেক্টর DB = $70/মাস। উদ্ধার = নগণ্য। LLM = 20,000 x (3,000 ইনপুট টোকেন x $2.50/1M + 500 আউটপুট টোকেন x $10/1M) = $250.00। মোট = প্রতি মাসে প্রায় $321।চলক বর্ণনা
▾
| প্রতীক | নাম | একক | বিবরণ |
|---|---|---|---|
| D | ডকুমেন্ট কর্পাস সাইজ | documents | ভেক্টর ডাটাবেসে সংরক্ষিত টেক্সট নথি বা খণ্ডের মোট সংখ্যা, যা এম্বেডিং খরচ এবং ভেক্টর স্টোরেজ প্রয়োজনীয়তা নির্ধারণ করে। |
| T_chunk | খণ্ড প্রতি টোকেন | tokens | ডকুমেন্ট খণ্ড প্রতি গড় টোকেন গণনা, সাধারণত RAG সিস্টেমে সর্বোত্তম পুনরুদ্ধার গ্রানুলারিটির জন্য 256 থেকে 512 টোকেন। |
| K | খণ্ডগুলি প্রতি প্রশ্নে পুনরুদ্ধার করা হয়েছে | chunks | প্রতিটি ব্যবহারকারীর প্রশ্নের জন্য ভেক্টর ডাটাবেস থেকে পুনরুদ্ধার করা অনুরূপ নথির খণ্ডের সংখ্যা, সাধারণত প্রশ্নগুলির জটিলতার উপর নির্ভর করে 3 থেকে 8। |
| Q | মাসিক কোয়েরি ভলিউম | queries per month | প্রতি মাসে RAG পাইপলাইন দ্বারা প্রক্রিয়াকৃত ব্যবহারকারীর প্রশ্নের মোট সংখ্যা, যা পুনরুদ্ধার এবং LLM অনুমান উভয় খরচ চালায়। |
| C_vdb | ভেক্টর DB মাসিক খরচ | USD per month | ভেক্টর ডাটাবেস পরিষেবার জন্য নির্দিষ্ট বা ব্যবহার-ভিত্তিক মাসিক হোস্টিং খরচ, সার্ভারহীনের জন্য $10 থেকে ডেডিকেটেড পডের জন্য $200 বা তার বেশি। |
| C_llm | প্রশ্ন প্রতি LLM খরচ | USD per query | পুনরুদ্ধার করা প্রসঙ্গ প্রক্রিয়াকরণ এবং একটি প্রতিক্রিয়া তৈরি করার জন্য ভাষা মডেলের অনুমান খরচ, সাধারণত প্রতি ক্যোয়ারীতে $0.005 থেকে $0.05 এ সবচেয়ে বড় একক খরচ উপাদান। |
কীভাবে RAG Pipeline Cost Calculator
▾
- 1আপনার ডকুমেন্ট কর্পাসের জন্য এমবেডিং খরচ গণনা করুন। নথির মোট সংখ্যা, বিভক্ত করার পরে প্রতি খণ্ডে গড় টোকেন এবং খণ্ডগুলির মধ্যে যে কোনও ওভারল্যাপ নির্ধারণ করুন। প্রতি মিলিয়ন টোকেনে 0.02 ডলারে টেক্সট-এমবেডিং-3-ছোট ব্যবহার করে, 15 শতাংশ ওভারল্যাপ সহ 400 টোকেনে 100,000 নথির একটি কর্পাস প্রাথমিক এম্বেডিংয়ের জন্য প্রায় $0.92 খরচ হয়। এটি শুধুমাত্র নতুন বা আপডেট হওয়া নথিগুলির জন্য ক্রমবর্ধমান খরচ সহ, কয়েক মাস ধরে পরিবর্ধিত একটি এককালীন খরচ৷
- 2আপনার ভেক্টর ডাটাবেস হোস্টিং খরচ অনুমান. পাইনকোন সার্ভারহীন চার্জ রিড ইউনিট, রাইট ইউনিট এবং স্টোরেজের উপর ভিত্তি করে। 1536 মাত্রা সহ 100,000 ভেক্টরের একটি কর্পাসের জন্য আনুমানিক 600 MB স্টোরেজ প্রয়োজন। পাইনকোন পড-ভিত্তিক পরিকল্পনাগুলি একটি s1 পডের জন্য প্রতি মাসে $70 থেকে শুরু হয়৷ ওয়েভিয়েট ক্লাউড ছোট ক্লাস্টারের জন্য প্রতি মাসে $25 থেকে শুরু হয়। প্রতি মাসে $50 থেকে $150-এ স্ব-হোস্টেড pgvector VM ছোট স্থাপনার জন্য সবচেয়ে লাভজনক বিকল্প।
- 3ক্যোয়ারী প্রতি পুনরুদ্ধার খরচ গণনা. পরিচালিত ভেক্টর ডাটাবেসের জন্য, প্রতিটি মিল অনুসন্ধান ক্যোয়ারী এক শতাংশের ভগ্নাংশ খরচ করে। পাইনকোন সার্ভারহীন চার্জ প্রতি মিলিয়ন রিড ইউনিটে প্রায় $8, অনুরোধ করা ফলাফলের সংখ্যার উপর নির্ভর করে প্রতিটি কোয়েরি 5 থেকে 10 পঠিত ইউনিট ব্যবহার করে। স্ব-হোস্ট করা সমাধানের জন্য, ক্যোয়ারী খরচ কার্যকরভাবে স্থির হোস্টিং খরচের বাইরে শূন্য। পুনরুদ্ধারের খরচ সাধারণত RAG পাইপলাইনের ক্ষুদ্রতম উপাদান।
- 4প্রশ্ন প্রতি LLM অনুমান খরচ গণনা করুন, যা সাধারণত প্রভাবশালী খরচ। প্রতিটি RAG ক্যোয়ারী ইনপুট টোকেন হিসাবে ব্যবহারকারীর প্রশ্ন এবং পুনরুদ্ধার করা নথির অংশ পাঠায়, তারপর আউটপুট টোকেন হিসাবে একটি প্রতিক্রিয়া তৈরি করে। আপনি যদি 400 টোকেনের 5টি খণ্ড এবং প্রতিটি 200-টোকেন সিস্টেম প্রম্পট এবং 100-টোকেন ব্যবহারকারীর ক্যোয়ারী পুনরুদ্ধার করেন, তাহলে মোট ইনপুট 2,300 টোকেন। GPT-4o-তে 500-টোকেন প্রতিক্রিয়া সহ, প্রতিটি প্রশ্নের জন্য প্রায় $0.011 খরচ হয়। 20,000 মাসিক প্রশ্নে, LLM-এর মোট খরচ $212৷
- 5কর্পাস আপডেটের জন্য পুনরায় এমবেডিং খরচ যোগ করুন। যদি আপনার নথির 5 শতাংশ মাসিক পরিবর্তন হয়, তাহলে পুনঃ-এম্বেডিং খরচ প্রাথমিক এম্বেডিং খরচের 5 শতাংশ। একটি 100,000-ডকুমেন্ট কর্পাসের জন্য, এটি প্রতি মাসে প্রায় $0.05 যোগ করে, যা নগণ্য। যাইহোক, যদি আপনি এমবেডিং মডেলগুলি আপগ্রেড করার সময় সম্পূর্ণ কর্পাস পুনরায় এম্বেড করেন (বার্ষিক প্রস্তাবিত), একটি পর্যায়ক্রমিক ব্যয় হিসাবে সম্পূর্ণ প্রাথমিক এমবেডিং খরচের জন্য বাজেট।
- 6উন্নয়ন এবং অপারেশনাল ওভারহেড ফ্যাক্টর. RAG পাইপলাইনগুলির পুনরুদ্ধারের গুণমান, চঙ্কিং কৌশল টিউনিং এবং মাঝে মাঝে পুনরায় সূচীকরণের জন্য পর্যবেক্ষণ প্রয়োজন। একটি উত্পাদন RAG সিস্টেম বজায় রাখার জন্য ইঞ্জিনিয়ারিং সময় সাধারণত প্রতি মাসে 5 থেকে 10 ঘন্টা খরচ হয় প্রতি ঘন্টায় $100 থেকে $200, শ্রম খরচে $500 থেকে $2,000 যোগ করে। সরাসরি অবকাঠামোগত খরচ না হলেও, এই অপারেশনাল ওভারহেডটি মালিকানা গণনার মোট খরচ অন্তর্ভুক্ত করা উচিত।
- 7প্রতিটি উপাদানকে মোট খরচের শতাংশ হিসাবে দেখানো সম্পূর্ণ খরচ ভাঙ্গন পর্যালোচনা করুন। বেশিরভাগ RAG সিস্টেমের জন্য, LLM অনুমান 60 থেকে 80 শতাংশে প্রাধান্য পায়, ভেক্টর ডাটাবেস হোস্টিং 15 থেকে 30 শতাংশ, এবং এমবেডিং প্লাস পুনরুদ্ধার একসাথে 5 শতাংশের নিচে প্রতিনিধিত্ব করে। এই ডিস্ট্রিবিউশনের অর্থ হল মডেল নির্বাচন, প্রম্পট কম্প্রেশন বা পুনরুদ্ধার করা খণ্ড সংখ্যা হ্রাসের মাধ্যমে এলএলএম খরচ অপ্টিমাইজ করা মোট খরচের উপর সর্বোচ্চ প্রভাব ফেলে।
সমাধান করা উদাহরণ
▾
এককালীন $0.06 এ এমবেডিং খরচ নগণ্য৷ ভেক্টর ডিবি সার্ভারহীন এই স্কেলে প্রতি মাসে প্রায় $10 খরচ করে। GPT-4o-mini-এর সাথে LLM খরচ প্রতি মাসে প্রায় $32 (5,000 প্রশ্ন x 1,400 ইনপুট টোকেন x $0.15/1M + 300 আউটপুট x $0.60/1M)। ছোট ব্যবসার জন্য এটি একটি সাশ্রয়ী মূল্যের RAG সেটআপ।
ভেক্টর ডিবি একটি p2 পড হ্যান্ডলিং 1M ভেক্টরের জন্য প্রতি মাসে $200 খরচ করে। LLM অনুমান প্রতি মাসে $1,950 এ প্রাধান্য পায়: $3/1M এ 3,200 ইনপুট টোকেন (6 খণ্ড x 500 + ওভারহেড) সহ 50,000 প্রশ্ন এবং $15/1M এ 600 আউটপুট টোকেন। এম্বেড করার পরিমার্জিত খরচ প্রতি মাসে প্রায় $25 যোগ করে।
প্রতি মাসে $80 এ স্ব-হোস্টেড pgvector পরিচালিত ডাটাবেস প্রিমিয়াম এড়িয়ে যায়। $0.15/$0.60 এ GPT-4o-mini 30,000 প্রশ্নের জন্য প্রতি মাসে LLM খরচ $99 রাখে। এম্বেড করার খরচ প্রতি মাসে $3 যোগ করে। এই আর্কিটেকচারটি প্রতি মাসে $200 এর নিচে এন্টারপ্রাইজ RAG মানের 90 শতাংশ প্রদান করে।
বাস্তব প্রয়োগ
▾
গ্রাহক সহায়তা প্ল্যাটফর্মগুলি গ্রাহকের প্রশ্নের তাত্ক্ষণিক, সঠিক উত্তর প্রদানের জন্য তাদের সহায়তা ডকুমেন্টেশন এবং অতীতের টিকিট রেজোলিউশনের উপর RAG সিস্টেম তৈরি করে। GPT-4o-mini RAG পাইপলাইনের মাধ্যমে 50,000 সহায়তা নিবন্ধ সহ একটি SaaS কোম্পানি প্রতি মাসে প্রায় $400 খরচ করে। এটি 60 থেকে 70 শতাংশ প্রশ্ন স্বয়ংক্রিয়ভাবে পরিচালনা করে, 24/7 তাত্ক্ষণিক প্রতিক্রিয়া প্রদান করার সময় মানব এজেন্ট খরচে প্রতি মাসে $50,000 থেকে $80,000 সাশ্রয় করে।
আইনি গবেষণা প্ল্যাটফর্মগুলি অ্যাটর্নিদের প্রাকৃতিক ভাষার প্রশ্নের মাধ্যমে প্রাসঙ্গিক নজিরগুলি খুঁজে পেতে সক্ষম করার জন্য আদালতের লক্ষ লক্ষ মতামত, বিধি এবং প্রবিধানকে এম্বেড করে৷ বিশ্লেষণের জন্য Claude Sonnet 4 এবং পুনরুদ্ধারের জন্য Pinecone ব্যবহার করে 5 মিলিয়ন নথির অংশ সহ একটি আইনি AI স্টার্টআপ 20,000 জটিল আইনি প্রশ্নগুলি পরিবেশন করতে প্রতি মাসে প্রায় $5,000 খরচ করে৷ প্রতিটি প্রশ্ন যা একটি প্যারালিগাল 30 থেকে 60 মিনিট সময় নেয় তার 10 সেকেন্ডের মধ্যে উত্তর দেওয়া হয়।
স্বাস্থ্যসেবা সংস্থাগুলি চিকিত্সকদের জন্য প্রমাণ-ভিত্তিক সিদ্ধান্ত সমর্থন প্রদানের জন্য ক্লিনিকাল নির্দেশিকা, ড্রাগ ডেটাবেস এবং চিকিৎসা সাহিত্যের উপর RAG সিস্টেম তৈরি করে। 15,000 মাসিক ক্লিনিশিয়ান প্রশ্নগুলি পরিবেশন করে 2 মিলিয়ন মেডিকেল নথি সহ একটি হাসপাতাল সিস্টেম প্রতি মাসে প্রায় $1,200 ব্যয় করে। RAG সিস্টেম প্রতিটি উত্তরে নির্দিষ্ট নির্দেশিকা বিভাগ এবং গবেষণাপত্র উদ্ধৃত করে, চিকিৎসা সেটিংসে প্রয়োজনীয় ট্রেসেবিলিটি প্রদান করে।
ই-কমার্স কোম্পানিগুলি পণ্যের সুপারিশ চ্যাটবটগুলিকে শক্তি দিতে RAG ব্যবহার করে যা প্রাসঙ্গিক পণ্যের স্পেসিফিকেশন, পর্যালোচনা এবং তুলনা ডেটা পুনরুদ্ধার করে পণ্য সম্পর্কে বিস্তারিত প্রশ্নের উত্তর দিতে পারে। একটি GPT-4o-mini RAG পাইপলাইনের মাধ্যমে 200,000 মাসিক ক্রেতার প্রশ্নগুলি পরিবেশন করে 500,000 পণ্য পৃষ্ঠা সহ একজন খুচরা বিক্রেতা প্রতি মাসে প্রায় $800 খরচ করে৷ এটি গ্রাহকদের সঠিক পণ্য দ্রুত খুঁজে পেতে সাহায্য করে রূপান্তর হার 15 থেকে 25 শতাংশ বৃদ্ধি করে৷
বিশেষ ক্ষেত্র
▾
RAG সিস্টেমের জন্য যেগুলিকে রিয়েল-টাইম ডেটা আপডেটগুলি পরিচালনা করতে হবে (যেমন নিউজ ফিড,
RAG সিস্টেমগুলির জন্য যেগুলিকে রিয়েল-টাইম ডেটা আপডেটগুলি পরিচালনা করতে হবে (যেমন নিউজ ফিড, স্টক মূল্য, বা লাইভ ডকুমেন্টেশন), ঐতিহ্যগত ব্যাচ এম্বেডিং এবং সূচীকরণ পদ্ধতি অগ্রহণযোগ্য বিলম্বের পরিচয় দেয়। স্ট্রিমিং RAG আর্কিটেকচার যা তৈরির কয়েক সেকেন্ডের মধ্যে নথি এম্বেড এবং সূচী করে তার জন্য দ্রুত লেখার পারফরম্যান্স সহ সর্বদা-অন এমবেডিং পরিষেবা এবং ভেক্টর ডেটাবেস প্রয়োজন। এটি ব্যাচ প্রক্রিয়াকরণের তুলনায় এমবেডিং পরিকাঠামোর খরচ 5 থেকে 10 গুণ বাড়িয়ে দিতে পারে, কারণ আপনি পর্যায়ক্রমিক ব্যাচের চাকরির পরিবর্তে ক্রমাগত গণনার জন্য অর্থ প্রদান করছেন।
মাল্টি-মডাল RAG সিস্টেম যেগুলি ছবি, টেবিল, এবং পুনরুদ্ধার করে
মাল্টি-মডাল RAG সিস্টেমগুলি যেগুলি পাঠ্য ছাড়াও চিত্র, টেবিল এবং ডায়াগ্রামগুলি পুনরুদ্ধার করে এবং যুক্তি দেয় তা উল্লেখযোগ্যভাবে বেশি খরচের সম্মুখীন হয়। ডকুমেন্ট ইমেজকে এম্বেডিং-এ রূপান্তর করার জন্য ভিশন মডেলের প্রয়োজন হয় যার দাম টেক্সট এম্বেডিংয়ের চেয়ে টোকেন প্রতি 5 থেকে 20 গুণ বেশি। টেক্সট এম্বেডিংয়ের পাশাপাশি ইমেজ এম্বেডিং সংরক্ষণ করা ভেক্টর ডাটাবেসের আকার বাড়ায়। এবং জিপিটি-4o ভিশনের মতো মাল্টি-মডাল এলএলএম-এ পুনরুদ্ধার করা ছবিগুলি প্রতি ছবিতে 500 থেকে 2,000 টোকেন খরচ করে৷ একটি মাল্টি-মডাল RAG পাইপলাইন একটি পাঠ্য-শুধু সমতুল্য থেকে 3 থেকে 5 গুণ বেশি খরচ করতে পারে।
স্বাস্থ্যসেবা এবং অর্থের মতো অত্যন্ত নিয়ন্ত্রিত শিল্পের জন্য, RAG পাইপলাইন আবশ্যক
স্বাস্থ্যসেবা এবং অর্থের মতো উচ্চ নিয়ন্ত্রিত শিল্পগুলির জন্য, RAG পাইপলাইনে অবশ্যই অডিট লগিং, অ্যাক্সেস নিয়ন্ত্রণ এবং ডেটা লাইনেজ ট্র্যাকিং অন্তর্ভুক্ত থাকতে হবে যা অবকাঠামোগত জটিলতা এবং খরচ যোগ করে। সম্মতির উদ্দেশ্যে ক্যোয়ারী লগ, পুনরুদ্ধার করা নথি, এবং LLM প্রতিক্রিয়া সংরক্ষণ করা অতিরিক্ত স্টোরেজ খরচে প্রতি মাসে $50 থেকে $200 যোগ করতে পারে। ডেটা রেসিডেন্সির প্রয়োজনীয়তা মেটাতে একটি প্রাইভেট ভিপিসি বা অন-প্রিমিসেস পরিবেশের মধ্যে সম্পূর্ণ পাইপলাইন চালানো হলে স্ট্যান্ডার্ড ক্লাউড স্থাপনার তুলনায় পরিকাঠামোর খরচ 2 থেকে 3 গুণ বেড়ে যেতে পারে।
RAG পাইপলাইন কম্পোনেন্ট কস্ট রেঞ্জ (2025)
▾
| কম্পোনেন্ট | বাজেট বিকল্প | মিড-রেঞ্জ বিকল্প | এন্টারপ্রাইজ বিকল্প |
|---|---|---|---|
| এম্বেডিং (100K ডক্স) | $0.06 (3-ছোট) | $0.92 (3-ছোট + ওভারল্যাপ) | $9.20 (3-বড় + ওভারল্যাপ) |
| ভেক্টর ডাটাবেস | $0-50/মাস (pgvector) | $70-100/মাস (Pinecone s1) | $200-500/মাস (Pinecone p2) |
| প্রশ্ন প্রতি LLM | $0.001 (GPT-4o-mini) | $0.011 (GPT-4o) | $0.025 (ক্লদ সনেট 4) |
| মাসিক (10 হাজার প্রশ্ন) | $60-100 | $180-300 | $450-750 |
| মাসিক (100K প্রশ্ন) | $150-350 | $1,200-1,800 | $2,800-4,500 |
সচরাচর জিজ্ঞাসা
▾
একটি RAG পাইপলাইনে সবচেয়ে বড় খরচ চালক কি?
LLM অনুমান হল প্রভাবশালী খরচ, সাধারণত মোট মাসিক খরচের 60 থেকে 80 শতাংশের জন্য দায়ী। এর কারণ হল প্রতিটি ক্যোয়ারী হাজার হাজার পুনরুদ্ধার করা প্রসঙ্গ টোকেন এবং ব্যবহারকারীর ক্যোয়ারী এলএলএম-এ পাঠায়। সবচেয়ে কার্যকর ব্যয় অপ্টিমাইজেশান কৌশলগুলি এই উপাদানটিকে লক্ষ্য করে: GPT-4o-mini-এর মতো সস্তা মডেলগুলি ব্যবহার করে, পুনরুদ্ধার করা অংশগুলির সংখ্যা হ্রাস করা, LLM-এ পাঠানোর আগে প্রসঙ্গ সংকুচিত করা এবং ঘন ঘন অনুসন্ধানের ফলাফল ক্যাশ করা৷
আমি কিভাবে Pinecone, Weaviate, এবং pgvector এর মধ্যে নির্বাচন করব?
পাইনকোন সেট আপ এবং স্কেল করা সবচেয়ে সহজ তবে বড় স্থাপনার জন্য এটি সবচেয়ে ব্যয়বহুল। Weaviate একটি উদার বিনামূল্যে স্তরের সাথে বৈশিষ্ট্য এবং খরচের একটি ভাল ভারসাম্য অফার করে। যেকোনো স্ট্যান্ডার্ড ডাটাবেস সার্ভারে চলমান PostgreSQL দক্ষতা সম্পন্ন দলের জন্য pgvector হল সবচেয়ে সস্তা বিকল্প। 100,000 ভেক্টরের নিচে কর্পোরার জন্য, $50 VM-এ pgvector সাধারণত যথেষ্ট। 100,000 থেকে 10 মিলিয়ন ভেক্টরের জন্য, পাইনকোন সার্ভারহীন বা ওয়েভিয়েট ক্লাউড আরও ভাল পারফরম্যান্স-টু-কস্ট অনুপাত অফার করে।
কয়টি খণ্ড আমি প্রতি ক্যোয়ারী পুনরুদ্ধার করা উচিত?
3 থেকে 5 খণ্ড দিয়ে শুরু করুন এবং উত্তরের গুণমান পরিমাপ করুন। আরও খণ্ড পুনরুদ্ধার করা আরও প্রসঙ্গ সরবরাহ করে কিন্তু LLM ইনপুট টোকেন এবং খরচ বাড়ায়। 5 থেকে 7 খণ্ডের বাইরে, অতিরিক্ত প্রসঙ্গে প্রায়ই অপ্রয়োজনীয় বা অপ্রাসঙ্গিক তথ্য থাকে যা মডেলকে বিভ্রান্ত করতে পারে এবং উত্তরের গুণমানকে অবনমিত করতে পারে। 10 থেকে 20 জন প্রার্থীর প্রাথমিক পুনরুদ্ধার থেকে সবচেয়ে প্রাসঙ্গিক 3 থেকে 5টি অংশ নির্বাচন করতে একটি পুনঃ-র্যাঙ্কিং পদক্ষেপ (যেমন কোহেরে রিরাঙ্ক বা একটি ক্রস-এনকোডার মডেল) ব্যবহার করুন।
আমি কি উৎপাদন RAG জন্য একটি বিনামূল্যে ভেক্টর ডাটাবেস ব্যবহার করতে পারি?
হ্যাঁ, ছোট থেকে মাঝারি স্থাপনার জন্য। একটি বিদ্যমান PostgreSQL সার্ভারে চলমান pgvector শূন্য অতিরিক্ত খরচ যোগ করে। ক্রোমা এবং FAISS 1 মিলিয়ন ভেক্টরের অধীনে কর্পোরার জন্য ইন-মেমরি চালাতে পারে। ওয়েভিয়েট ক্লাউড একটি বিনামূল্যের স্যান্ডবক্স স্তর অফার করে যা উন্নয়ন এবং ছোট উৎপাদন কাজের চাপের জন্য উপযুক্ত। এই বিকল্পগুলি মাঝারি ক্যোয়ারী ভলিউম সহ 100,000 থেকে 500,000 ভেক্টরের জন্য কার্যকর, যদিও তাদের অর্থপ্রদান পরিচালিত পরিষেবাগুলির নির্ভরযোগ্যতার নিশ্চয়তার অভাব থাকতে পারে।
কিভাবে চঙ্কিং কৌশল RAG খরচ প্রভাবিত করে?
ছোট খণ্ডগুলি (128 থেকে 256 টোকেন) সংরক্ষিত এবং পুনরুদ্ধার করা ভেক্টরের সংখ্যা বাড়ায় কিন্তু আরও সুনির্দিষ্ট প্রসঙ্গ প্রদান করে। বড় অংশগুলি (512 থেকে 1024 টোকেন) ভেক্টর গণনা হ্রাস করে তবে প্রতিটি পুনরুদ্ধারে অপ্রাসঙ্গিক বিষয়বস্তু অন্তর্ভুক্ত করতে পারে। সর্বোত্তম খণ্ড আকার আপনার নথির ধরন এবং ক্যোয়ারী প্যাটার্নের উপর নির্ভর করে। বেশিরভাগ ব্যবহারের ক্ষেত্রে, 50 থেকে 100 টোকেন ওভারল্যাপের সাথে 256 থেকে 512 টোকেনগুলি পুনরুদ্ধারের নির্ভুলতা এবং খরচ দক্ষতার সর্বোত্তম ভারসাম্য প্রদান করে।
স্ক্র্যাচ থেকে একটি RAG সিস্টেম তৈরি করতে মোট খরচ কত?
একটি উত্পাদন RAG সিস্টেমের জন্য উন্নয়ন খরচ সাধারণত 80 থেকে 200 ইঞ্জিনিয়ারিং ঘন্টা ($8,000 থেকে $30,000 শ্রম)। এর মধ্যে রয়েছে ডকুমেন্ট প্রসেসিং পাইপলাইন, চঙ্কিং এবং এম্বেডিং, ভেক্টর ডাটাবেস সেটআপ, পুনরুদ্ধার যুক্তি, এলএলএম ইন্টিগ্রেশন, মূল্যায়ন কাঠামো এবং পর্যবেক্ষণ। চলমান অবকাঠামো খরচ ছোট স্থাপনার জন্য প্রতি মাসে $50 থেকে শুরু করে এন্টারপ্রাইজ স্কেলের জন্য প্রতি মাসে $5,000 বা তার বেশি। বেশিরভাগ দল 4 থেকে 8 সপ্তাহের মধ্যে উৎপাদন-প্রস্তুত গুণমানে পৌঁছায়।
এড়ানোর সাধারণ ভুল
▾
- !এলএলএম-এ অনেকগুলি পুনরুদ্ধার করা অংশ পাস করা:
- !সবচেয়ে ব্যয়বহুল LLM ব্যবহার করা যখন একটি বাজেট মডেল যথেষ্ট:
- !ছোট কর্পোরার জন্য ভেক্টর ডাটাবেসের অতিরিক্ত ব্যবস্থা করা:
প্রো টিপ
একটি শব্দার্থিক ক্যাশে প্রয়োগ করুন যা পূর্ববর্তী প্রশ্নগুলির এমবেডিং এবং তাদের তৈরি করা উত্তরগুলি সঞ্চয় করে৷ যখন একটি নতুন ক্যোয়ারী শব্দার্থগতভাবে (0.95 এর উপরে কোসাইন সাদৃশ্য) একটি ক্যাশে করা প্রশ্নের সাথে হয়, তখন সম্পূর্ণ RAG পাইপলাইন চালানোর পরিবর্তে ক্যাশে করা উত্তরটি ফেরত দিন। এটি পুনরাবৃত্তিমূলক ক্যোয়ারী প্যাটার্ন সহ অ্যাপ্লিকেশনগুলির জন্য LLM অনুমান খরচ 30 থেকে 50 শতাংশ কমাতে পারে, যেমন গ্রাহক সহায়তা যেখানে একই প্রশ্নগুলি প্রায়শই জিজ্ঞাসা করা হয়।
আপনি কি জানেন?
রিট্রিভাল-অগমেন্টেড জেনারেশনের ধারণাটি ফেসবুক এআই রিসার্চ (এখন মেটা এআই) 2020 সালের একটি গবেষণাপত্রে প্রবর্তন করেছে। তারপর থেকে, আরএজি উৎপাদন এলএলএম অ্যাপ্লিকেশন তৈরির জন্য সবচেয়ে ব্যাপকভাবে গৃহীত প্যাটার্ন হয়ে উঠেছে, যা আনুমানিক 80 শতাংশ এন্টারপ্রাইজ এআই স্থাপনার দ্বারা ব্যবহৃত হয়। পুনরুদ্ধার এবং প্রজন্মের সংমিশ্রণ কাঁচা এলএলএমগুলির সাথে দুটি বৃহত্তম সমস্যা সমাধান করে: হ্যালুসিনেশন এবং মালিকানা বা বর্তমান ডেটা অ্যাক্সেসের অভাব।
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
তথ্যসূত্র
সাপ্তাহিক গণিত টিপস পান
১২,০০০+ সদস্যদের সাথে যোগ দিন যারা প্রতি সপ্তাহে ক্যালকুলেটর টিপস পান।