Skip to content
Skip to main content
DigiCalcs

Specialiseret

Speech-to-Text API Cost Calculator

Hvad er Speech-to-Text API Cost Calculator?

▾

Tale-til-tekst-omkostningsberegneren estimerer omkostningerne ved at transskribere lyd til tekst ved hjælp af AI-tjenester, herunder OpenAI Whisper API ($0,006 pr. minut), Google Cloud Speech-to-Text ($0,016 pr. minut for standardmodeller), AWS Transscribe ($0,024 pr. minut), Deepgram ($0,0043 pr. minut for 0,0043 $ pr. minut). Disse tjenester konverterer talt sprog til skrevet tekst med 90 til 98 procent nøjagtighed afhængigt af lydkvalitet, sprog og modelvalg. Denne lommeregner betjener podcastproduktionsvirksomheder, callcenteranalyseteams, juridiske transskriptionstjenester, medievirksomheder, der undertekster videoindhold og mødeproduktivitetsværktøjer, der genererer automatiserede transskriptioner. En 60-minutters podcast-episode koster $0,36 at transskribere med Whisper API, $0,96 med Google Speech eller $0,26 med Deepgram. I skala forstærkes disse forskelle betydeligt: ​​Et callcenter, der transskriberer 10.000 timers opkald om måneden, ville betale $3.600 med Whisper, $9.600 med Google eller $2.580 med Deepgram. Ud over de grundlæggende transskriptionsomkostninger tager regnemaskinen også højde for funktioner, der påvirker prisfastsættelsen: højttalerdiarisering (identifikation af, hvem der sagde hvad), realtid versus batchbehandling (realtid koster typisk 2 til 3 gange mere), specialiserede ordforrådsmodeller og efterbehandlingsomkostninger til formatering, indsættelse af tegnsætning og afsnitssegmentering. At forstå den fulde omkostningsstack hjælper teams med at vælge den rigtige service til deres nøjagtighedskrav og budgetbegrænsninger.

DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.

Formel

▾
f(x)Transskriptionsomkostninger = lydvarighed i minutter x pris pr. minut. For batchbehandling af 500 timers lyd pr. måned på Whisper API: Pris = 500 x 60 x $0,006 = $180,00 pr. måned. Til transskription i realtid på Google Cloud til 2x hastighed: Pris = 500 x 60 x 0,032 USD = 960,00 USD.

Variabelbeskrivelse

▾
SymbolNavnEnhedBeskrivelse
DLydvarighedminutesSamlet lydindhold, der skal transskriberes, målt i minutter, med typisk tale, der indeholder 130 til 160 ord i minuttet.
PPris per minutUSD per minuteTransskriptionstjenesten pr. minut af lyd, der spænder fra $0,0043 for Deepgram til $0,024 for AWS Transcribe.
R_streamStreaming multiplikatorratio (1.5 to 3.0)Omkostningsmultiplikatoren for streaming-transskription i realtid versus batchbehandling, der anvendes, når der kræves resultater med lav latens.
T_reviewGennemgangstid pr. lydtimeminutesMenneskelig gennemgang og korrektionstid påkrævet pr. time transskriberet lyd, typisk 10 til 30 minutter afhængig af nøjagtighedskrav.
HAnmelder timeprisUSD per hourOmkostninger til menneskelige redaktører, der gennemgår og retter AI-transskriptioner, spænder fra $25 til $75 i timen afhængigt af domæneekspertise.

Sådan Speech-to-Text API Cost Calculator

▾
  1. 1Bestem din samlede lydvarighed for at transskribere pr. måned. Mål i minutter eller timer, og skeln mellem forudindspillet (batch) og live (realtid) lyd. Batchtransskription er typisk billigere og kan acceptere længere behandlingstider. Transskription i realtid leverer resultater, når lyden strømmer ind, men koster 1,5 til 3 gange mere på grund af beregningsintensiteten ved behandling med lav latens.
  2. 2Vælg din transskriptionstjeneste baseret på nøjagtighedskrav, sprogsupport og budget. Whisper API tilbyder det bedste pris-til-kvalitet-forhold for de fleste sprog til $0,006 pr. minut. Deepgram Nova-2 er den billigste løsning til $0,0043 pr. minut med konkurrencedygtig nøjagtighed. Google Cloud og AWS tilbyder den bredeste sprogunderstøttelse og integration med deres respektive cloud-økosystemer. AssemblyAI leverer de bedste funktioner til højttalerdiaarisering og indholdsanalyse.
  3. 3Konfigurer transskriptionsfunktioner, der påvirker priserne. Højttalerdiarisering (identifikation af forskellige højttalere) tilføjer 10 til 30 procent til basistransskriptionsomkostningerne på de fleste platforme. Tegnsætning og store bogstaver er inkluderet som standard på moderne tjenester. Realtidsstreaming koster 2 til 3 gange mere end batchbehandling. Tilpasset ordforråd eller branchespecifikke modeller kan have ekstra omkostninger på nogle platforme.
  4. 4Beregn basistransskriptionsomkostningerne ved at gange det samlede lydminutter med hastigheden pr. minut. For blandede realtids- og batch-arbejdsbelastninger skal du beregne hver enkelt separat: batchlyd med standardhastigheden og realtidslyd med forhøjet hastighed. Sum de to for den samlede månedlige transskriptionsudgift.
  5. 5Tilføj efterbehandlingsomkostninger, hvis det er relevant. Rå transskriptionsoutput har ofte brug for formatering: afsnitsskift, højttaleretiketter, tidsstempelindsættelse, fyldordsfjernelse og domænespecifikke rettelser. Automatiseret efterbehandling ved hjælp af en LLM (GPT-4o-mini) koster cirka $0,001 til $0,005 pr. minut af behandlet lyd. Manuel efterbehandling af en menneskelig redaktør koster $0,50 til $2,00 pr. lydminut afhængigt af den nødvendige nøjagtighed.
  6. 6Tag hensyn til lageromkostninger for lydfiler og transskriptioner. Lydfiler ved 128 kbps bruger cirka 1 MB pr. minut. Transskriptionstekst er ubetydelig i størrelse. Cloud storage til $0,02 pr. GB pr. måned betyder, at 10.000 timers lyd (600 GB) koster $12 pr. måned at opbevare. Hvis du har brug for at beholde lyden for at overholde reglerne, skal du inkludere disse løbende lageromkostninger.
  7. 7Sammenlign de samlede omkostninger med menneskelige transskriptionstjenester. Professionel menneskelig transskription koster $1,00 til $3,00 pr. lydminut for standardomsætning og $2,00 til $5,00 for hastelevering. AI-transskription ved $0,004 til $0,024 per minut er 40 til 750 gange billigere. Selv med menneskelig kvalitetsgennemgang, der tilføjer $0,25 til $0,50 pr. minut, forbliver AI-assisteret transskription 50 til 85 procent billigere end fuldstændig manuel transskription.

Løste eksempler

▾
Eksempel 1Podcast produktionsselskab
Givet:40, 60, OpenAI Whisper API, 0,006, batch
Resultat:$14,40 per måned ($0,36 per episode)

40 episoder á 60 minutter hver i alt 2.400 lydminutter. Ved $0,006 pr. minut er den månedlige pris $14,40. Dette erstatter en menneskelig transskriptionstjeneste, der ville opkræve $2.400 til $7.200 om måneden for det samme volumen. De 99 procents omkostningsreduktion gør fuld transskription økonomisk rentabel for hver episode.

Eksempel 2Call Center-analyse (realtid)
Givet:5000, Deepgram Nova-2 (streaming), 0,0059, højttalerdiaarisering, følelse
Resultat:$1.770,00 om måneden

5.000 timer (300.000 minutter) af opkaldstransskription i realtid med højttalerdiarisering til 0,0059 USD pr. minut. Deepgram-streamingpriser inkluderer diaarisering. Dette muliggør agentassistance i realtid og analyser efter opkald til overholdelse og kvalitetssikring til en brøkdel af prisen for dedikerede QA-analytikere.

Eksempel 3Lovlig afleveringstransskription
Givet:30, 120, AssemblyAI med højttaleretiketter, 0,0065, 0,25, 60
Resultat:$473,40 per måned (AI: $23,40, menneskelig anmeldelse: $450)

30 afsætninger på 120 minutter hver i alt 3.600 lydminutter. AI-transskription koster $23,40. Menneskelig anmeldelse med 15 minutter pr. lydtime (900 timers samlet gennemgangstid) til $60/time tilføjer $450. I alt er $473,40 mod $7.200 til $14.400 for fuld menneskelig retsreporter-transskription.

Eksempel 4Videotekstning for medievirksomhed
Givet:200, 15, Google Cloud tale-til-tekst, 0,016, 0,002
Resultat:$54,00 om måneden

200 videoer á 15 minutter hver i alt 3.000 lydminutter. Transskription til $0,016 pr. minut er $48,00, plus billedtekstformatering ved $0,002 pr. minut tilføjer $6,00. ADA-overholdelsestekster til 200 videoer til $54 om måneden gør tilgængelighed overkommelig for indholdsskabere i alle størrelser.

Praktiske anvendelser

▾
🏗️

Podcast-hostingplatforme tilbyder automatisk transskription som en premium-funktion. En platform, der hoster 10.000 podcasts med et gennemsnit på 4 episoder om måneden på 45 minutter hver transskriberer 1,8 millioner lydminutter om måneden. Ved at bruge Whisper API til $0,006 pr. minut, er den månedlige pris $10.800. Opkrævet til $5 om måneden til podcast-skabere som en premium-funktion, med 3.000 abonnenter, der genererer $15.000 i omsætning, er funktionen rentabel, samtidig med at den giver tilgængelighed og SEO-fordele.

🔬

Sundhedsorganisationer transskriberer læge-patient-møder til journaldokumentation. Et hospitalsnetværk med 500 læger med i gennemsnit 20 patientmøder om dagen på 15 minutter hver genererer 150.000 lydminutter om måneden. Brug af en HIPAA-kompatibel service til $0,01 pr. minut koster $1.500 pr. måned. Medicinske programmerere gennemgår udskrifter på 5 minutter pr. møde til $30 i timen, og tilføjer $25.000 om måneden. Samlede omkostninger på $26.500 erstatter $75.000 pr. måned i manuel medicinsk transskription.

📊

Medieselskaber undertekster videoindhold for overholdelse af tilgængelighed og SEO. En streamingplatform med 5.000 timers nyt indhold om måneden bruger Google Cloud Speech til 0,016 USD pr. minut, hvilket koster 4.800 USD om måneden for transskription. Automatisk billedtekstformatering tilføjer $600. Menneskelig QA-gennemgang på 10 minutter pr. indholdstime tilføjer $8.333. Samlede undertekstomkostninger på $13.733 pr. måned sammenlignet med $50.000 til $100.000 for manuelle underteksttjenester.

🏥

Markedsundersøgelsesfirmaer transskriberer fokusgrupper og kundeinterviews. Et firma, der udfører 200 interviews om måneden på 45 minutter hver, bruger AssemblyAI med højttalerdiaarisering til $0,0065 pr. minut, hvilket koster $58,50 pr. måned for transskription. Forskere bruger 10 minutter pr. interview på at gennemgå og kommentere transskriptioner til $75 i timen, hvilket tilføjer $2.500. De månedlige omkostninger på $2.558,50 muliggør hurtig analyse, som tidligere krævede dedikeret transskriptionspersonale til $8.000 pr. måned.

Særlige tilfælde

▾

For HIPAA-kompatibel medicinsk transkription er ikke alle tjenester berettigede.

Google Cloud Speech, AWS Transcribe og Azure Speech tilbyder HIPAA-kompatible konfigurationer med Business Associate Agreements. OpenAI Whisper API og Deepgram tilbyder virksomhedsaftaler med overholdelsescertificeringer. Self-hosted Whisper på HIPAA-kompatibel infrastruktur giver mest kontrol, men kræver dedikeret sikkerhed og compliance ekspertise. Medicinsk transskription drager også fordel af tilpassede ordforrådsmodeller, der er trænet i medicinsk terminologi.

Til transskribering af lyd i støjende omgivelser (byggepladser, restauranter,

Til transskribering af lyd i støjende miljøer (byggepladser, restauranter, udendørs arrangementer) kan nøjagtigheden falde til 60 til 75 procent selv med de bedste modeller. Forbehandling med støjreduktionsværktøjer som RNNoise eller DeepFilterNet kan forbedre nøjagtigheden med 10 til 20 procentpoint til ubetydelige beregningsomkostninger. For ekstremt støjende lyd er en to-pass tilgang (støjreduktion efterfulgt af transskription) mere nøjagtig og i sidste ende billigere end at stole på menneskelig korrektion af lavkvalitetstransskriptioner.

Til arkivtransskription af historiske lydoptagelser (analoge optagelser,

Til arkivtransskription af historiske lydoptagelser (analoge optagelser, gamle telefonsystemer, forringet bånd), er lydkvaliteten forbundet med de teknologiske begrænsninger for ældre modeller. Disse optagelser kan have lave samplingsfrekvenser (8kHz telefon), betydelig baggrundsstøj og forældet ordforråd. Specialiseret forbehandling til at upsample og afsløre lyden, kombineret med finjusterede modeller til den specifikke lydkvalitet, kan forbedre nøjagtigheden fra 50 til 60 procent (standardmodeller) til 80 til 90 procent, til en ekstra forbehandlingsomkostning på $0,002 til $0,01 pr. minut.

Prissammenligning af tale-til-tekst-tjenester (2025)

▾
ServiceBatchpris/minStreaming pris/minDiariseringSprogGratis niveau
OpenAI Whisper API0,006 USDN/ANo99+No
Deepgram Nova-2$0,00430,0059 USDJa ($0,0049)36+12.000 min
ForsamlingAI0,0065 USD$0,0085Ja (inkluderet)20+100 timer
Google Cloud Speech0,016 USD0,032 USDJa (0,02 USD)125+60 min/md
AWS Transskribering0,024 USD0,024 USDJa (inkluderet)100+60 min/md. (12 mdr.)
Azure tale0,016 USD0,016 USDJa (0,02 USD)100+5 timer/md

Ofte stillede spørgsmål

▾
Q

Hvilken tale-til-tekst-tjeneste er mest nøjagtig?

A

For engelsk opnår OpenAI Whisper og Deepgram Nova-2 den højeste nøjagtighed ved 95 til 98 procent ordfejlfrekvens på ren lyd. Google Cloud Speech og AWS Transcribe er sammenlignelige med 93 til 97 procent. For specialiserede domæner (medicinske, juridiske, økonomiske) kan tilpassede ordforrådsmodeller på Google Cloud eller AWS forbedre nøjagtigheden med 3 til 5 procentpoint. Nøjagtigheden falder 5 til 15 procentpoint for støjende lyd, tunge accenter eller flersproget indhold.

Q

Hvordan er Whisper API sammenlignet med selvhostet Whisper?

A

OpenAI Whisper API til $0,006 pr. minut er en administreret tjeneste uden infrastruktur at administrere. Selvvært Whisper on a cloud GPU (A10G til $1,10/time) behandler lyd med cirka 10 til 30 gange realtidshastighed, hvilket koster $0,001 til $0,002 pr. minut ved fuld udnyttelse. Selvhosting er 3 til 6 gange billigere, men kræver GPU-styring, skalering og overvågning. Break-even er cirka 5.000 til 10.000 lydminutter om måneden.

Q

Hvad er forskellen mellem batch- og realtidstransskription?

A

Batch-transskription behandler forudindspillede lydfiler og returnerer resultater på minutter til timer. Realtidstransskription (streaming) behandler lyd, efterhånden som den optages, og returnerer ord inden for 200 til 500 ms efter at være blevet talt. Batch er 1,5 til 3 gange billigere og er velegnet til optaget indhold. Realtid er afgørende for live undertekster, mødetransskription og hjælp til callcenter-agenter. De fleste udbydere tilbyder begge tilstande.

Q

Hvor nøjagtig er AI-transskription til møder med flere højttalere?

A

Moderne tjenester opnår 90 til 95 procent nøjagtighed til møder med tydelig turtagning mellem 2 til 4 højttalere. Nøjagtigheden falder til 80 til 90 procent med overlappende tale, mere end 6 højttalere eller dårlig mikrofonkvalitet. Højttalerdiaarisering (identifikation af, hvem der sagde hvad) er 85 til 95 procent nøjagtig for veladskilte højttalere, men kan falde til under 80 procent i kaotiske mødemiljøer. Brug af højkvalitetsmikrofoner og optageopsætninger forbedrer resultaterne markant.

Q

Kan jeg transskribere på andre sprog end engelsk?

A

Ja, alle større tjenester understøtter flere sprog. Whisper understøtter 99+ sprog med varierende nøjagtighed. Google Cloud understøtter mere end 125 sprog. Nøjagtigheden for ikke-engelske sprog er typisk 3 til 10 procentpoint lavere end engelsk. Til tonale sprog som mandarin og thai tilbyder specialiserede modeller bedre nøjagtighed. Prisen pr. minut er generelt den samme uanset sprog, selvom nogle tjenester opkræver en præmie for mindre almindelige sprog.

Almindelige fejl at undgå

▾
  • !Brug af realtidsprissætning for batch-arbejdsbelastninger:
  • !Tager ikke højde for lydkvalitetens indvirkning på nøjagtigheden:
  • !Ignorerer højttalerdiariseringsomkostninger for multi-højttalerlyd:
💡

Pro Tip

For maksimal omkostningseffektivitet på store transkriptionsarbejdsbelastninger, kan du selv hoste Whisper på en cloud-GPU med automatisk skalering. En A10G GPU til $1,10 i timen transskriberer lyd med cirka 15 gange realtidshastighed, hvilket koster omkring $0,001 per minut. Konfigurer en automatisk skaleringskø, der spinner GPU'er op, når lydfiler sendes, og lukker dem ned, når køen er tom. Denne tilgang sparer 70 til 85 procent i forhold til Whisper API, mens den håndterer variable arbejdsbelastninger effektivt.

⭐

Vidste du?

OpenAI Whisper blev trænet i 680.000 timers flersproget lyd, hvilket svarer til at lytte non-stop i 77 år. På trods af at den blev udgivet som en open source-model i 2022, er Whisper API fortsat en af ​​de mest populære transskriptionstjenester, fordi bekvemmeligheden ved API-adgang opvejer omkostningsbesparelserne ved selvhosting for de fleste organisationer.

Regional Guides

▾
North America▾
Engelsk transskription i Nordamerika opnår de højeste nøjagtighedsgrader (95 til 98 procent), fordi modellerne primært er trænet i nordamerikansk engelsk. Alle større tjenester er tilgængelige med amerikansk datacenterbehandling. For HIPAA-reguleret sundhedstransskription kræves amerikansk hostede tjenester med BAA-aftaler. Spansk transskription for amerikanske latinamerikanske markeder opnår 90 til 95 procent nøjagtighed på større platforme.
Europe▾
Den europæiske transskriptionsarbejdsbelastning står over for flersprogede udfordringer med 24 officielle EU-sprog. GDPR kræver, at lyddata behandles inden for EU's grænser til personlige samtaler. Google Cloud, AWS og Azure tilbyder behandling i EU-regionen. Whisper API-processer i USA som standard, hvilket kan kræve databehandlingsaftaler for overholdelse af GDPR. Nøjagtigheden for europæiske sprog varierer fra 93 til 97 procent for vesteuropæiske sprog til 88 til 93 procent for østeuropæiske sprog.
Asia-Pacific▾
Transskription på CJK-sprog giver unikke udfordringer på grund af fraværet af ordgrænser på kinesisk og japansk, og den tonale karakter af mandarin, kantonesisk og thai. Nøjagtighed for CJK-sprog er typisk 88 til 94 procent, lavere end engelsk. Lokale tjenester som iFlytek (Kina), Naver Clova (Korea) og NTT (Japan) udkonkurrerer ofte globale tjenester for deres respektive sprog. Pris pr. minut er sammenlignelig med engelsk transskription på trods af den ekstra beregningsmæssige kompleksitet.
📖Sværhedsgrad:Begynder
Accuracy-checked
Reviewed October 2026
Our methodology

Få ugentlige matematiktips

Slut dig til 12.000+ abonnenter, der får lommeregnertips hver uge.

🔒
100% Gratis
Ingen registrering
✓
Præcis
Verificerede formler
⚡
Øjeblikkelig
Resultater med det samme
📱
Mobilvenlig
Alle enheder

Indstillinger

PrivatlivVilkårOm© 2026 DigiCalcs