Skip to content
Skip to main content
DigiCalcs

Spesialisert

Speech-to-Text API Cost Calculator

Hva er Speech-to-Text API Cost Calculator?

▾

Tale-til-tekst-kostnadskalkulatoren estimerer kostnadene ved å transkribere lyd til tekst ved hjelp av AI-tjenester, inkludert OpenAI Whisper API ($0,006 per minutt), Google Cloud Speech-to-Text ($0,016 per minutt for standardmodeller), AWS Transcribe ($0,024 per minutt), Deepgram ($0,000432 per minutt for 0,0 Novbly-0AI) per minutt). Disse tjenestene konverterer talespråk til skrevet tekst med 90 til 98 prosent nøyaktighet avhengig av lydkvalitet, språk og modellvalg. Denne kalkulatoren betjener podcastproduksjonsselskaper, analyseteam for callsenter, juridiske transkripsjonstjenester, medieselskaper som tekster videoinnhold og møteproduktivitetsverktøy som genererer automatiserte transkripsjoner. En 60-minutters podcastepisode koster $0,36 å transkribere med Whisper API, $0,96 med Google Speech, eller $0,26 med Deepgram. I stor skala forsterker disse forskjellene betydelig: et kundesenter som transkriberer 10 000 timer med samtaler per måned vil betale $3600 med Whisper, $9600 med Google eller $2580 med Deepgram. Utover grunnleggende transkripsjonskostnader tar kalkulatoren også for funksjoner som påvirker prissettingen: høyttalerdiarisering (identifiserer hvem som sa hva), sanntid versus batchbehandling (sanntid koster vanligvis 2 til 3 ganger mer), spesialiserte vokabularmodeller og etterbehandlingskostnader for formatering, innsetting av tegnsetting og avsnittssegmentering. Å forstå hele kostnadsstabelen hjelper teamene med å velge riktig tjeneste for deres nøyaktighetskrav og budsjettbegrensninger.

DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.

Formel

▾
f(x)Transkripsjonskostnad = lydvarighet i minutter x pris per minutt. For batchbehandling av 500 timer med lyd per måned på Whisper API: Kostnad = 500 x 60 x $0,006 = $180,00 per måned. For sanntidstranskripsjon på Google Cloud med 2x rate: Kostnad = 500 x 60 x $0,032 = $960,00.

Variabelbeskrivelse

▾
SymbolNavnEnhetBeskrivelse
DLydvarighetminutesTotalt lydinnhold som skal transkriberes, målt i minutter, med typisk tale som inneholder 130 til 160 ord per minutt.
PPris per minuttUSD per minuteTranskripsjonstjenesten per minutt med lyd, fra $0,0043 for Deepgram til $0,024 for AWS Transcribe.
R_streamStreaming multiplikatorratio (1.5 to 3.0)Kostnadsmultiplikatoren for transkripsjon av transkripsjon i sanntid versus batchbehandling, brukes når resultater med lav latens er påkrevd.
T_reviewGjennomgangstid per lydtimeminutesMenneskelig gjennomgang og korrigeringstid som kreves per time med transkribert lyd, vanligvis 10 til 30 minutter avhengig av nøyaktighetskrav.
HTimepris for anmelderUSD per hourKostnader for menneskelige redaktører som gjennomgår og korrigerer AI-transkripsjoner, fra $25 til $75 per time avhengig av domeneekspertise.

Slik Speech-to-Text API Cost Calculator

▾
  1. 1Bestem den totale lydvarigheten du skal transkribere per måned. Mål i minutter eller timer og skille mellom forhåndsinnspilt (batch) og live (sanntid) lyd. Batch-transkripsjon er vanligvis billigere og kan godta lengre behandlingstider. Sanntidstranskripsjon gir resultater når lyden strømmer inn, men koster 1,5 til 3 ganger mer på grunn av beregningsintensiteten til prosessering med lav latens.
  2. 2Velg transkripsjonstjenesten din basert på nøyaktighetskrav, språkstøtte og budsjett. Whisper API tilbyr det beste forholdet mellom pris og kvalitet for de fleste språk til $0,006 per minutt. Deepgram Nova-2 er det billigste alternativet til $0,0043 per minutt med konkurransedyktig nøyaktighet. Google Cloud og AWS tilbyr den bredeste språkstøtten og integrasjonen med sine respektive skyøkosystemer. AssemblyAI gir de beste funksjonene for høyttalerdiaarisering og innholdsanalyse.
  3. 3Konfigurer transkripsjonsfunksjoner som påvirker prisene. Diaarisering av høyttalere (identifisering av forskjellige høyttalere) legger til 10 til 30 prosent til basale transkripsjonskostnader på de fleste plattformer. Tegnsetting og store bokstaver er inkludert som standard på moderne tjenester. Sanntidsstrømming koster 2 til 3 ganger mer enn batchbehandling. Tilpasset vokabular eller bransjespesifikke modeller kan ha ekstra kostnader på enkelte plattformer.
  4. 4Beregn basistranskripsjonskostnaden ved å multiplisere totale lydminutter med minutthastigheten. For blandede sanntids- og batch-arbeidsbelastninger, kalkuler hver enkelt separat: batch-lyd med standardhastighet og sanntidslyd med forhøyet hastighet. Sum de to for totale månedlige transkripsjonskostnader.
  5. 5Legg til etterbehandlingskostnader hvis det er aktuelt. Rå transkripsjonsutdata trenger ofte formatering: avsnittsskift, høyttaleretiketter, tidsstempelinnsetting, fjerning av utfyllingsord og domenespesifikke rettelser. Automatisert etterbehandling ved hjelp av en LLM (GPT-4o-mini) koster omtrent $0,001 til $0,005 per minutt behandlet lyd. Manuell etterbehandling av en menneskelig redaktør koster $0,50 til $2,00 per lydminutt avhengig av nødvendig nøyaktighet.
  6. 6Ta hensyn til lagringskostnader for lydfiler og transkripsjoner. Lydfiler ved 128 kbps bruker omtrent 1 MB per minutt. Transkripsjonstekst er ubetydelig i størrelse. Skylagring til $0,02 per GB per måned betyr at 10 000 timer med lyd (600 GB) koster $12 per måned å lagre. Hvis du trenger å beholde lyd for samsvar, inkluderer denne løpende lagringskostnaden.
  7. 7Sammenlign totale kostnader med menneskelige transkripsjonstjenester. Profesjonell menneskelig transkripsjon koster $1,00 til $3,00 per lydminutt for standard behandlingstid og $2,00 til $5,00 for rushlevering. AI-transkripsjon på $0,004 til $0,024 per minutt er 40 til 750 ganger billigere. Selv med menneskelig kvalitetsvurdering som legger til $0,25 til $0,50 per minutt, forblir AI-assistert transkripsjon 50 til 85 prosent billigere enn fullstendig manuell transkripsjon.

Løste eksempler

▾
Eksempel 1Podcast produksjonsselskap
Gitt:40, 60, OpenAI Whisper API, 0,006, batch
Resultat:$14,40 per måned ($0,36 per episode)

40 episoder på 60 minutter hver totalt 2400 lydminutter. Ved $0,006 per minutt er den månedlige kostnaden $14,40. Dette erstatter en menneskelig transkripsjonstjeneste som ville belaste $2400 til $7200 per måned for samme volum. Kostnadsreduksjonen på 99 prosent gjør full transkripsjon økonomisk levedyktig for hver episode.

Eksempel 2Call Center Analytics (sanntid)
Gitt:5000, Deepgram Nova-2 (streaming), 0,0059, høyttalerdiaris, sentiment
Resultat:$1 770,00 per måned

5 000 timer (300 000 minutter) med sanntids samtaletranskripsjon med høyttalerdiarisering til $0,0059 per minutt. Deepgram-strømmingspriser inkluderer diarisering. Dette muliggjør agentassistanse i sanntid og analyser etter anrop for overholdelse og kvalitetssikring til en brøkdel av kostnadene for dedikerte QA-analytikere.

Eksempel 3Transkripsjon av juridisk deponering
Gitt:30, 120, AssemblyAI med høyttaleretiketter, 0,0065, 0,25, 60
Resultat:$473,40 per måned (AI: $23,40, menneskelig vurdering: $450)

30 avsetninger på 120 minutter hver totalt 3600 lydminutter. AI-transkripsjon koster $23,40. Menneskelig gjennomgang på 15 minutter per lydtime (900 timer total gjennomgangstid) til $60/time gir $450. Totalt er $473.40 mot $7.200 til $14.400 for fullstendig menneskelig rettsreporter-transkripsjon.

Eksempel 4Videoteksting for medieselskap
Gitt:200, 15, Google Cloud Speech-to-Text, 0,016, 0,002
Resultat:$54,00 per måned

200 videoer på 15 minutter hver totalt 3000 lydminutter. Transkripsjon til $0,016 per minutt er $48,00, pluss bildetekstformatering til $0,002 per minutt gir $6,00. ADA-samsvarsteksting for 200 videoer til $54 per måned gjør tilgjengelighet rimelig for innholdsskapere i alle størrelser.

Praktiske anvendelser

▾
🏗️

Podcast-vertsplattformer tilbyr automatisk transkripsjon som en premiumfunksjon. En plattform som er vert for 10 000 podcaster med et gjennomsnitt på 4 episoder per måned på 45 minutter hver transkriberer 1,8 millioner lydminutter månedlig. Ved å bruke Whisper API til $0,006 per minutt, er den månedlige kostnaden $10 800. Belastet med $5 per måned til podcastskapere som en premium-funksjon, med 3000 abonnenter som genererer $15.000 i inntekter, er funksjonen lønnsom samtidig som den gir tilgjengelighet og SEO-fordeler.

🔬

Helseorganisasjoner transkriberer møter mellom lege og pasient for journaldokumentasjon. Et sykehusnettverk med 500 leger med i gjennomsnitt 20 pasientmøter per dag på 15 minutter hver genererer 150 000 lydminutter per måned. Å bruke en HIPAA-kompatibel tjeneste til $0,01 per minutt koster $1500 per måned. Medisinske kodere vurderer transkripsjoner på 5 minutter per møte til $30 per time, og legger til $25 000 månedlig. Totalkostnad på $26 500 erstatter $75 000 per måned i manuell medisinsk transkripsjon.

📊

Medieselskaper tekster videoinnhold for samsvar med tilgjengelighet og SEO. En strømmeplattform med 5000 timer med nytt innhold per måned bruker Google Cloud Speech til $0,016 per minutt, og koster $4800 månedlig for transkripsjon. Automatisert bildetekstformatering gir $600. Menneskelig QA-gjennomgang på 10 minutter per innholdstime gir $8 333. Total kostnad for teksting på $13 733 per måned sammenlignet med $50 000 til $100 000 for manuelle tekstingtjenester.

🏥

Markedsundersøkelsesfirmaer transkriberer fokusgrupper og kundeintervjuer. Et firma som gjennomfører 200 intervjuer per måned på 45 minutter hver bruker AssemblyAI med høyttalerdiarier til $0,0065 per minutt, og koster $58,50 per måned for transkripsjon. Forskere bruker 10 minutter per intervju på å gjennomgå og kommentere transkripsjoner til $75 per time, og legger til $2500. Den månedlige kostnaden på $2 558,50 muliggjør rask analyse som tidligere krevde dedikerte transkripsjonspersonale til $ 8 000 per måned.

Spesielle tilfeller

▾

For HIPAA-kompatibel medisinsk transkripsjon er ikke alle tjenester kvalifisert.

Google Cloud Speech, AWS Transcribe og Azure Speech tilbyr HIPAA-kompatible konfigurasjoner med Business Associate-avtaler. OpenAI Whisper API og Deepgram tilbyr bedriftsavtaler med samsvarssertifiseringer. Self-hosted Whisper på HIPAA-kompatibel infrastruktur gir mest kontroll, men krever dedikert sikkerhets- og samsvarsekspertise. Medisinsk transkripsjon drar også nytte av tilpassede ordforrådsmodeller som er trent på medisinsk terminologi.

For å transkribere lyd i støyende miljøer (byggeplasser, restauranter,

For å transkribere lyd i støyende miljøer (byggeplasser, restauranter, utendørsarrangementer), kan nøyaktigheten falle til 60 til 75 prosent selv med de beste modellene. Forbehandling med støyreduksjonsverktøy som RNNoise eller DeepFilterNet kan forbedre nøyaktigheten med 10 til 20 prosentpoeng til ubetydelige beregningskostnader. For ekstremt støyende lyd er en to-pass tilnærming (støyreduksjon etterfulgt av transkripsjon) mer nøyaktig og til slutt billigere enn å stole på menneskelig korreksjon av transkripsjoner av lav kvalitet.

For arkivtranskripsjon av historiske lydopptak (analoge opptak,

For arkivtranskripsjon av historiske lydopptak (analoge opptak, gamle telefonsystemer, degradert bånd), problemer med lydkvaliteten sammen med teknologibegrensningene til eldre modeller. Disse opptakene kan ha lave samplingsfrekvenser (8kHz telefon), betydelig bakgrunnsstøy og utdatert ordforråd. Spesialisert forhåndsbehandling for å oppsample og forringe lyden, kombinert med finjusterte modeller for den spesifikke lydkvaliteten, kan forbedre nøyaktigheten fra 50 til 60 prosent (standardmodeller) til 80 til 90 prosent, mot en ekstra forbehandlingskostnad på $0,002 til $0,01 per minutt.

Prissammenligning av tale-til-tekst-tjenester (2025)

▾
ServiceBatchpris/minStreaming Pris/minDiariseringSpråkGratis lag
OpenAI Whisper API$0,006N/ANo99+No
Deepgram Nova-2$0,0043$0,0059Ja ($0,0049)36+12 000 min
AssemblyAI$0,0065$0,0085Ja (inkludert)20+100 timer
Google Cloud Speech$0,016$0,032Ja ($0,02)125+60 min/md
AWS-transkriberer$0,024$0,024Ja (inkludert)100+60 min/mnd (12 mnd)
Azure tale$0,016$0,016Ja ($0,02)100+5 timer/mnd

Ofte stilte spørsmål

▾
Q

Hvilken tale-til-tekst-tjeneste er mest nøyaktig?

A

For engelsk oppnår OpenAI Whisper og Deepgram Nova-2 den høyeste nøyaktigheten med 95 til 98 prosent ordfeilfrekvens på ren lyd. Google Cloud Speech og AWS Transcribe er sammenlignbare med 93 til 97 prosent. For spesialiserte domener (medisinsk, juridisk, økonomisk) kan tilpassede ordforrådsmodeller på Google Cloud eller AWS forbedre nøyaktigheten med 3 til 5 prosentpoeng. Nøyaktigheten synker 5 til 15 prosentpoeng for støyende lyd, tunge aksenter eller flerspråklig innhold.

Q

Hvordan er Whisper API sammenlignet med selvvertsbaserte Whisper?

A

OpenAI Whisper API til $0,006 per minutt er en administrert tjeneste uten infrastruktur å administrere. Selvdrevet Whisper on a cloud GPU (A10G til $1,10/time) behandler lyd med omtrent 10 til 30 ganger sanntidshastighet, og koster $0,001 til $0,002 per minutt ved full utnyttelse. Selvhosting er 3 til 6 ganger billigere, men krever GPU-administrasjon, skalering og overvåking. Break-even er omtrent 5 000 til 10 000 lydminutter per måned.

Q

Hva er forskjellen mellom batch- og sanntidstranskripsjon?

A

Batch-transkripsjon behandler forhåndsinnspilte lydfiler og returnerer resultater på minutter til timer. Sanntidstranskripsjon (streaming) behandler lyd mens den fanges opp og returnerer ord innen 200 til 500 ms etter at de blir talt. Batch er 1,5 til 3 ganger billigere og passer for innspilt innhold. Sanntid er essensielt for direkte teksting, møtetranskripsjon og assistanse for kundesenteragenter. De fleste tilbydere tilbyr begge modusene.

Q

Hvor nøyaktig er AI-transkripsjon for møter med flere høyttalere?

A

Moderne tjenester oppnår 90 til 95 prosent nøyaktighet for møter med tydelig turtaking mellom 2 til 4 høyttalere. Nøyaktigheten synker til 80 til 90 prosent med overlappende tale, mer enn 6 høyttalere eller dårlig mikrofonkvalitet. Diaarisering av høyttalere (som identifiserer hvem som sa hva) er 85 til 95 prosent nøyaktig for godt adskilte høyttalere, men kan falle under 80 prosent i kaotiske møtemiljøer. Bruk av høykvalitets mikrofoner og opptaksoppsett forbedrer resultatene betraktelig.

Q

Kan jeg transkribere på andre språk enn engelsk?

A

Ja, alle større tjenester støtter flere språk. Whisper støtter 99+ språk med varierende nøyaktighet. Google Cloud støtter 125+ språk. Nøyaktigheten for ikke-engelske språk er vanligvis 3 til 10 prosentpoeng lavere enn engelsk. For tonale språk som mandarin og thai gir spesialiserte modeller bedre nøyaktighet. Prisen per minutt er generelt den samme uavhengig av språk, selv om noen tjenester tar en premie for mindre vanlige språk.

Vanlige feil å unngå

▾
  • !Bruk av sanntidsprising for batcharbeidsbelastninger:
  • !Tar ikke hensyn til lydkvalitetens innvirkning på nøyaktigheten:
  • !Ignorerer høyttalerdiariseringskostnader for lyd med flere høyttalere:
💡

Pro Tips

For maksimal kostnadseffektivitet på store transkripsjonsarbeidsmengder, host Whisper selv på en sky-GPU med automatisk skalering. En A10G GPU til $1,10 per time transkriberer lyd med omtrent 15 ganger sanntidshastighet, og koster omtrent $0,001 per minutt. Sett opp en automatisk skaleringskø som spinner opp GPUer når lydfiler sendes inn og slår dem av når køen er tom. Denne tilnærmingen sparer 70 til 85 prosent i forhold til Whisper API mens du håndterer variable arbeidsbelastninger effektivt.

⭐

Visste du?

OpenAI Whisper ble trent på 680 000 timer med flerspråklig lyd, tilsvarende lytting uten stans i 77 år. Til tross for at den ble utgitt som en åpen kildekode-modell i 2022, er Whisper API fortsatt en av de mest populære transkripsjonstjenestene fordi bekvemmeligheten med API-tilgang oppveier kostnadsbesparelsene ved selvhosting for de fleste organisasjoner.

Regional Guides

▾
North America▾
Engelsk transkripsjon i Nord-Amerika oppnår de høyeste nøyaktighetsgradene (95 til 98 prosent) fordi modellene primært er trent på nordamerikansk engelsk. Alle større tjenester er tilgjengelige med amerikansk datasenterbehandling. For HIPAA-regulert helsevesenet transkripsjon, kreves amerikansk vertstjenester med BAA-avtaler. Spansk transkripsjon for amerikanske latinamerikanske markeder oppnår 90 til 95 prosent nøyaktighet på store plattformer.
Europe▾
Europeiske transkripsjonsarbeidsmengder står overfor flerspråklige utfordringer med 24 offisielle EU-språk. GDPR krever at lyddata behandles innenfor EUs grenser for personlige samtaler. Google Cloud, AWS og Azure tilbyr behandling av EU-regioner. Whisper API-prosesser i USA som standard, noe som kan kreve databehandlingsavtaler for overholdelse av GDPR. Nøyaktigheten for europeiske språk varierer fra 93 til 97 prosent for vesteuropeiske språk til 88 til 93 prosent for østeuropeiske språk.
Asia-Pacific▾
Transkripsjon på CJK-språk gir unike utfordringer på grunn av fraværet av ordgrenser på kinesisk og japansk, og den tonale naturen til mandarin, kantonesisk og thai. Nøyaktigheten for CJK-språk er vanligvis 88 til 94 prosent, lavere enn engelsk. Lokale tjenester som iFlytek (Kina), Naver Clova (Korea) og NTT (Japan) utkonkurrerer ofte globale tjenester for sine respektive språk. Pris per minutt kan sammenlignes med engelsk transkripsjon til tross for den ekstra beregningsmessige kompleksiteten.
📖Vanskelighetsgrad:Nybegynner
Accuracy-checked
Reviewed October 2026
Our methodology

Få ukentlige mattetips

Bli med 12 000+-abonnenter som får kalkulatortips hver uke.

🔒
100% Gratis
Ingen registrering
✓
Nøyaktig
Verifiserte formler
⚡
Øyeblikkelig
Resultater med én gang
📱
Mobilevennlig
Alle enheter

Innstillinger

PersonvernVilkårOm© 2026 DigiCalcs