Wat is LLM Embedding Cost Calculator?
▾
De LLM Embedding Cost Calculator schat de totale kosten van het genereren van vectorinsluitingen voor tekstgegevens met behulp van commerciële API-modellen zoals OpenAI text-embedding-3-small, text-embedding-3-large en de oudere ada-002. Insluitingen zetten tekst om in dichte numerieke vectoren (doorgaans 256 tot 3072 dimensies) die de semantische betekenis vastleggen, waardoor zoek-, clustering- en retrieval-augmented generatie (RAG) pijplijnen op het gebied van gelijkenis mogelijk worden. Vanaf 2025 prijst OpenAI text-embedding-3-small op $0,02 per miljoen tokens en text-embedding-3-large op $0,13 per miljoen tokens, terwijl de oudere ada-002 beschikbaar blijft voor $0,10 per miljoen tokens. Alternatieven zijn onder meer Cohere Embed v3 voor ongeveer $ 0,10 per miljoen tokens en gratis open-sourcemodellen zoals BGE, E5 en GTE waarvoor een zelfgehoste GPU-infrastructuur vereist is. Deze rekenmachine wordt dagelijks gebruikt door machine learning-ingenieurs die semantische zoeksystemen bouwen, productteams die door AI aangedreven aanbevelingen toevoegen, en data-ingenieurs die ETL-pijplijnen ontwerpen die documenten opnieuw moeten insluiten wanneer modellen worden bijgewerkt. Een typische zakelijke kennisbank van één miljoen documenten met elk 500 tokens bedraagt in totaal 500 miljoen tokens, wat slechts $10 kost met text-embedding-3-small, maar $65 met text-embedding-3-large. Het begrijpen van deze kostenverschillen is essentieel voor het kiezen van de juiste kwaliteit-kostenverhouding. Naast de ruwe API-kosten voor inbedding, houdt deze calculator ook rekening met het opsplitsen van overhead (overlappende chunks kunnen het aantal tokens met 10 tot 30 procent verhogen), de frequentie van opnieuw inbedden voor documentupdates en de aanvullende kosten voor het opslaan van vectoren in een database zoals Pinecone, Weaviate of pgvector. Door de volledige pijplijn te modelleren, kunnen teams weloverwogen beslissingen nemen over modelselectie, blokgroottes en updatefrequenties, waardoor de kosten voorspelbaar blijven naarmate de datavolumes groeien.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Formule
▾
Totale inbeddingskosten = (aantal documenten x gemiddelde tokens per document x (1 + overlapverhouding)) / 1.000.000 x prijs per tokens van 1 miljoen. Bijvoorbeeld het insluiten van 200.000 documenten met elk 400 tokens met een overlap van 15 procent met behulp van text-embedding-3-small voor $ 0,02 per 1 miljoen tokens: Totaal aantal tokens = 200.000 x 400 x 1,15 = 92.000.000 tokens. Kosten = (92.000.000 / 1.000.000) x $0,02 = 92 x $0,02 = $1,84.Variabele uitleg
▾
| Symbool | Naam | Eenheid | Beschrijving |
|---|---|---|---|
| N | Aantal documenten | documents | Het totale aantal tekstdocumenten of voorgefragmenteerde tekstsegmenten in uw corpus die moeten worden omgezet in vectorinsluitingen. |
| T_avg | Gemiddelde tokens per document | tokens | Het gemiddelde aantal tokens per document of deel, meestal gemeten met behulp van de tiktoken-bibliotheek of de OpenAI-tokenizer-tool voor nauwkeurige BPE-tokentellingen. |
| O | Overlappingsverhouding | ratio (0 to 0.5) | De fractie tokens die wordt gedeeld tussen opeenvolgende chunks in een chunking-strategie met een verschuivend venster, gewoonlijk ingesteld tussen 0,10 en 0,25 om de continuïteit van de context te behouden. |
| P | Prijs per miljoen tokens | USD per 1M tokens | De kosten die door de insluitende API-provider in rekening worden gebracht voor het verwerken van één miljoen tokens, zoals $0,02 voor text-embedding-3-small of $0,13 voor text-embedding-3-large. |
| U | Maandelijkse updatesnelheid | ratio (0 to 1) | Het deel van de documenten in het corpus dat elke maand wordt toegevoegd, gewijzigd of verwijderd en waarbij opnieuw insluiten nodig is om de vectorindex actueel te houden. |
| D | Vectorafmetingen | dimensions | Het aantal dimensies in elke ingesloten vectoruitvoer, dat de opslagvereisten en zoekprestaties bepaalt. Gemeenschappelijke waarden zijn 256, 1536 en 3072. |
Hoe LLM Embedding Cost Calculator
▾
- 1Begin met het tellen van het totale aantal documenten of tekstblokken in uw corpus. Dit kunnen productbeschrijvingen, ondersteuningsartikelen, PDF-pagina's of elk tekstblok zijn dat u doorzoekbaar wilt maken. Als u onbewerkte documenten heeft die nog niet in blokken zijn verdeeld, schat dan hoeveel blokken elk zal opleveren op basis van uw doelgrootte (doorgaans 256 tot 512 tokens) en de overlapinstellingen.
- 2Bepaal het gemiddelde tokenaantal per chunk. U kunt de OpenAI tokenizer-tool of de tiktoken Python-bibliotheek gebruiken om het exacte tokenaantal voor voorbeelddocumenten te meten. Een grove vuistregel is dat één token gelijk is aan ongeveer vier Engelse karakters of 0,75 woorden. Voor meertalige corpora kan het aantal tokens 1,5 tot 2 keer hoger zijn dan bij Engelse equivalenten, vanwege de manier waarop bytepaarcodering omgaat met niet-Latijnse scripts.
- 3Selecteer uw insluitingsmodel en noteer het prijsniveau ervan. OpenAI text-embedding-3-small kost $0,02 per miljoen tokens, text-embedding-3-large kost $0,13 per miljoen tokens, en ada-002 kost $0,10 per miljoen tokens. Het kleine model produceert standaard vectoren met 1536 dimensies (configureerbaar tot 256), terwijl het grote model 3072 dimensies produceert. Hogere dimensies leveren over het algemeen een betere ophaalkwaliteit op, ten koste van meer opslagruimte en langzamer zoeken naar gelijkenissen.
- 4Configureer uw chunking-overlappingsverhouding. De meeste RAG-implementaties gebruiken een overlap van 10 tot 20 procent tussen opeenvolgende chunks om de context aan de chunkgrenzen te behouden. Een overlapverhouding van 0,15 betekent dat elk deel 15 procent van zijn tokens deelt met het volgende deel, waardoor uw totale aantal tokens effectief met datzelfde percentage wordt verhoogd. Dit is een kostenvermenigvuldiger die vaak over het hoofd wordt gezien.
- 5Bereken de eenmalige insluitingskosten door het totale aantal tokens (inclusief overlap) te vermenigvuldigen met de modelprijs. Maak vervolgens een schatting van uw maandelijkse kosten voor het opnieuw inbedden op basis van het deel van uw corpus dat elke maand verandert. Als 5 procent van de documenten maandelijks wordt bijgewerkt, bedragen uw terugkerende kosten 5 procent van de initiële insluitingskosten. Sommige teams hebben ook hun hele corpus opnieuw ingebed bij de migratie naar een nieuwere modelversie voor verbeterde kwaliteit.
- 6Houd rekening met de kosten voor vectoropslag die een aanvulling vormen op de kosten voor inbedding. Pinecone rekent $0,096 per pod-uur voor zijn s1 pod-type, Weaviate Cloud begint bij $25 per maand voor kleine clusters, en zelf-gehoste pgvector op een bescheiden cloud-VM kost $50 tot $150 per maand. De totale eigendomskosten voor insluitingen omvatten zowel het genereren als de doorlopende opslag en query's.
- 7Bekijk de uiteindelijke uitsplitsing van de kosten, waarin de kosten per document, de totale eenmalige kosten, de geschatte maandelijks terugkerende kosten en de kosten voor vectoropslag worden weergegeven. Gebruik dit om modellen te vergelijken en een datagestuurde beslissing te nemen. Veel teams vinden dat text-embedding-3-small 95 procent of meer van de ophaalkwaliteit biedt van text-embedding-3-large tegen 85 procent lagere kosten, waardoor dit de standaardkeuze is voor de meeste productieworkloads.
Uitgewerkte voorbeelden
▾
Het totale aantal tokens met overlap is gelijk aan 50.000 keer 300 keer 1,10, wat 16.500.000 tokens is. Delen door één miljoen en vermenigvuldigen met $0,02 levert $0,33 op. Dit laat zien hoe betaalbaar het inbedden van kleine tot middelgrote corpora is geworden met moderne prijzen.
Twee miljoen documenten met 600 tokens met een overlap van 20 procent levert in totaal 1.440.000.000 tokens op. Bij $0,13 per miljoen tokens zijn de kosten $187,20 voor het volledige corpus. Hoewel dit niet triviaal is, zijn dit eenmalige kosten die kunnen worden afgeschreven over maanden van productiegebruik.
Door te migreren van ada-002 naar text-embedding-3-small voor 500.000 documenten bespaart u ongeveer 80 procent op de insluitingskosten. Het nieuwere model biedt ook betere ophaalbenchmarks, waardoor migratie zowel goedkoper als van hogere kwaliteit is.
Niet-Latijnse scripts verhogen het tokenaantal doorgaans met 50 tot 100 procent in vergelijking met Engels. De 700 tokens per document verklaren deze inflatie al. De totale kosten zijn 300.000 keer 700 keer 1,15 gedeeld door 1.000.000 keer $0,13, wat gelijk is aan $31,40.
Praktische toepassingen
▾
E-commercebedrijven integreren miljoenen productbeschrijvingen om semantische zoekfuncties mogelijk te maken die zoekopdrachten in natuurlijke taal begrijpen, zoals 'warme waterdichte jas om te wandelen', in plaats van dat er exacte trefwoorden nodig zijn. Een grote retailer met 5 miljoen producten met een gemiddelde van 200 tokens per stuk zou slechts $ 20 uitgeven aan het gebruik van text-embedding-3-small om hun volledige catalogus in te sluiten, waardoor zoekervaringen mogelijk worden gemaakt die de conversieratio's en de gemiddelde bestelwaarde aanzienlijk verhogen.
Juridische technologiebedrijven integreren jurisprudentiedatabases met honderdduizenden gerechtelijke adviezen, zodat advocaten relevante precedenten kunnen vinden via zoekopdrachten in natuurlijke taal. Een typisch juridisch corpus van 500.000 documenten met elk 800 tokens met een overlap van 20 procent kost ongeveer $ 9,60 met text-embedding-3-small. Deze eenmalige investering vervangt handmatig juridisch onderzoek dat voorheen uren per zaak in beslag nam, wat een enorm rendement op de investering oplevert.
Klantondersteuningsplatforms integreren hun volledige kennisbank met helpartikelen, veelgestelde vragen en eerdere ticketresoluties om automatisch relevante antwoorden voor te stellen wanneer klanten nieuwe tickets indienen. Een bedrijf met 100.000 ondersteuningsartikelen kan deze voor minder dan $ 1 insluiten met text-embedding-3-small en vervolgens cosinus-gelijkenis gebruiken om inkomende vragen te vergelijken met bestaande oplossingen. Hierdoor wordt doorgaans 40 tot 60 procent van de tickets afgewezen voordat ze een menselijke agent bereiken.
Bedrijven op het gebied van gezondheidszorgtechnologie integreren medische literatuur en klinische richtlijnen om systemen voor het genereren van gegevens met verbeterde retrieval te bouwen waarmee artsen snel op bewijs gebaseerde antwoorden op klinische vragen kunnen vinden. Een database van 2 miljoen onderzoekssamenvattingen met 400 tokens kost elk ongeveer $ 16 om in te sluiten. De vectorrepresentaties maken semantische matching mogelijk die medische synoniemen en gerelateerde concepten begrijpt op een manier die traditionele trefwoordzoekopdrachten niet kunnen.
Bijzondere gevallen
▾
Bij het insluiten van zeer korte teksten zoals producttitels of zoekopdrachten kan dat
Bij het insluiten van zeer korte teksten, zoals producttitels of zoekopdrachten die slechts 5 tot 20 tokens lang zijn, worden de kosten per document verwaarloosbaar (minder dan $ 0,0000004 elk met text-embedding-3-small), maar de totale API-aanroepoverhead kan het knelpunt worden. OpenAI-insluitingseindpunten accepteren batches van maximaal 2048 teksten per verzoek, en het in batches samenvoegen van korte teksten verbetert de doorvoer dramatisch van honderden tot tienduizenden insluitingen per seconde. Zorg ervoor dat u altijd korte teksten in batches verzendt in plaats van afzonderlijke API-aanroepen te verzenden.
Voor corpora van meer dan 100 miljoen documenten moet bij de kostenberekening rekening worden gehouden
Voor corpora van meer dan 100 miljoen documenten moet bij de kostenberekening rekening worden gehouden met API-snelheidslimieten en de tijdsdimensie. OpenAI-insluitingseindpunten hebben snelheidslimieten gemeten in tokens per minuut, en het insluiten van 100 miljoen documenten met elk 500 tokens (50 miljard tokens) bij een snelheidslimiet van 5 miljoen tokens per minuut zou bijna zeven dagen van continue verwerking vergen. Op deze schaal is het zelf hosten van een open-sourcemodel op meerdere GPU's doorgaans praktischer en kosteneffectiever, waarbij zelfs rekening wordt gehouden met de complexiteit van de infrastructuur.
Houd er bij het bouwen van meertalige inbeddingssystemen rekening mee dat het aantal tokens aanzienlijk varieert tussen talen.
Een passage van 100 woorden in het Engels kan 130 tokens gebruiken, terwijl voor dezelfde betekenis, uitgedrukt in het Japans, 200 tot 250 tokens nodig kunnen zijn vanwege tokenisatie op tekenniveau. Dit betekent dat de kosten voor het inbedden van Japanse, Chinese, Koreaanse, Thaise en Arabische corpora 50 tot 100 procent hoger kunnen zijn dan die van vergelijkbare Engelse corpora. Budgetteer dienovereenkomstig en overweeg taalspecifieke inbeddingsmodellen die efficiënter kunnen tokeniseren voor uw doeltalen.
Prijsvergelijking van modellen inbedden (2025)
▾
| Model | Aanbieder | Prijs per 1M-tokens | Standaardafmetingen | Max. tokens | MTEB-score |
|---|---|---|---|---|---|
| tekst-embedding-3-klein | OpenAI | $ 0,02 | 1536 | 8191 | 62,3% |
| tekst-embedding-3-groot | OpenAI | $ 0,13 | 3072 | 8191 | 64,6% |
| tekst-inbedding-ada-002 | OpenAI | $ 0,10 | 1536 | 8191 | 61,0% |
| embed-v3 (Engels) | Samenhangen | $ 0,10 | 1024 | 512 | 64,5% |
| Gemini tekst-inbedding-004 | Googlen | $ 0,00625 | 768 | 2048 | 66,3% |
| BGE-groot-en-v1.5 | Open bron | Zelf gehost | 1024 | 512 | 63,6% |
| E5-groot-v2 | Open bron | Zelf gehost | 1024 | 512 | 62,7% |
Veelgestelde vragen
▾
Welk inbeddingsmodel biedt de beste prijs-kwaliteitverhouding?
Voor de meeste productietoepassingen levert OpenAI text-embedding-3-small de beste balans tussen kwaliteit en kosten, met een waarde van $ 0,02 per miljoen tokens. Het scoort binnen 2 tot 5 procentpunten van text-embedding-3-large op standaard ophaalbenchmarks zoals MTEB, terwijl het 85 procent minder kost. Het grote model van $0,13 per miljoen tokens is de premie alleen waard als je werkt met zeer gespecialiseerde domeinen waarbij elk procentpunt van de ophaalnauwkeurigheid van belang is, zoals juridische of medische zoekopdrachten.
Hoeveel tokens bevat een typisch document?
Een standaard Engels document van 500 woorden bevat ongeveer 625 tot 700 tokens met behulp van BPE-tokenisatie. Voor RAG-toepassingen worden documenten doorgaans opgedeeld in segmenten van 256 tot 512 tokens met een overlap van 50 tot 128 tokens. Eén token bestaat uit ongeveer vier Engelse tekens of 0,75 woorden. Niet-Latijnse scripts zoals Chinees, Japans en Koreaans kunnen 1,5 tot 2 keer meer tokens per woord gebruiken vanwege de manier waarop byte-paar-codering met hun tekensets omgaat.
Moet ik het kleine of grote inbeddingsmodel gebruiken?
Begin met text-embedding-3-small voor ontwikkeling en initiële productie-implementatie. Meet de meetgegevens van uw ophaalkwaliteit, zoals terugroepen bij k en gemiddelde wederzijdse rangorde op uw specifieke gegevens. Als deze statistieken onder uw kwaliteitsdrempel liggen, upgrade dan naar text-embedding-3-large en vergelijk. In de praktijk vindt minder dan 20 procent van de teams dat de kwaliteitsverbetering ten opzichte van het grote model de 6,5 keer hogere kosten rechtvaardigt.
Hoe verhouden de insluitingskosten zich tot de opslagkosten voor vectordatabases?
Het inbedden van generatie is doorgaans een eenmalige of onregelmatige kostenpost, terwijl vectoropslag een doorlopende maandelijkse uitgave is. Voor een miljoen vectoren met 1536 dimensies bedraagt de onbewerkte opslag ongeveer 6 GB. In Pinecone kan dit €70 tot €100 per maand kosten, afhankelijk van uw podconfiguratie. De initiële insluitingskosten met text-embedding-3-small voor dezelfde miljoen documenten zouden ongeveer $10 tot $15 bedragen, een eenmalige vergoeding. Over een jaar zijn de kosten voor vectoropslag gewoonlijk vijf tot tien keer hoger dan de kosten voor het inbedden van opwekking.
Kan ik de inbeddingskosten verlagen door de vectordimensies te verlagen?
Ja, text-embedding-3-small en text-embedding-3-large ondersteunen beide Matryoshka-dimensiereductie, waardoor u vectoren kunt afkappen tot minder dimensies zonder opnieuw in te bedden. Door de afmetingen terug te brengen van 1536 naar 256 worden de opslag- en zoekkosten met ongeveer 83 procent verlaagd, terwijl de kwaliteit van het ophalen slechts bescheiden afneemt. Deze techniek is vooral handig voor grootschalige toepassingen waarbij de kosten voor opslag en zoeklatentie de totale eigendomskosten domineren.
Is het goedkoper om open-source inbeddingsmodellen zelf te hosten?
Zelfhostende modellen zoals BGE-large of E5-large-v2 op een cloud-GPU worden op schaal kosteneffectief. Eén enkele A10G GPU-instantie voor ongeveer $ 1 per uur kan ongeveer 1.000 tot 2.000 documenten per seconde insluiten. Bij 10 miljoen documenten kost zelfhosting ongeveer $5 tot $10 aan rekentijd, tegenover $2 tot $13 via API. U draagt echter ook de kosten van infrastructuurbeheer, monitoring en schaalvergroting. Het break-evenpunt ligt doorgaans rond de 50 tot 100 miljoen tokens per maand voor doorlopende werklasten.
Hoe vaak moet ik mijn documenten opnieuw insluiten?
Sluit documenten alleen opnieuw in als de inhoud wezenlijk verandert of als u migreert naar een nieuw insluitingsmodel. Voor inhoudsupdates implementeert u incrementeel opnieuw insluiten, waarbij alleen gewijzigde documenten worden verwerkt in plaats van het hele corpus. De meeste teams integreren hun volledige corpus één of twee keer per jaar opnieuw wanneer ze upgraden naar een nieuwere modelversie. Door een pijplijn voor wijzigingsdetectie in te stellen die gewijzigde documenten markeert voor opnieuw insluiten, blijven de kosten evenredig aan uw werkelijke inhoudsverloop.
Veelgemaakte fouten om te vermijden
▾
- !Verwarring van inbeddingsprijzen met LLM-inferentieprijzen:
- !Het negeren van chunking-overlappingstoken-overhead:
- !Het opnieuw inbedden van kosten vergeten wanneer modellen worden bijgewerkt:
Pro Tip
Gebruik text-embedding-3-small met Matryoshka-dimensiereductie tot 256 dimensies voor prototyping. Dit levert vectoren op die zes keer kleiner zijn dan de standaard 1536 dimensies, waardoor de opslag- en zoekkosten drastisch worden verlaagd, terwijl de ophaalkwaliteit ongeveer 90 procent behouden blijft. U kunt altijd opnieuw insluiten met volledige dimensionaliteit voor productie als uw evaluatiestatistieken dit vereisen.
Wist je dat?
De volledige Engelse Wikipedia, die ongeveer 6,7 miljoen artikelen bevat met grofweg 4,4 miljard tokens, kan voor ongeveer $ 88 volledig worden ingesloten met behulp van text-embedding-3-small. Dit betekent dat het creëren van een complete semantische zoekmachine voor alle menselijke kennis, verzameld op Wikipedia, minder kost dan een enkel diner in een restaurant uit het middensegment.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
Referenties
Ontvang wekelijkse wiskundetips
Sluit u aan bij 12.000+ abonnees die elke week rekenmachinetips krijgen.