Was ist Speech-to-Text API Cost Calculator?
▾
Der Speech-to-Text-Kostenrechner schätzt die Kosten für die Transkribierung von Audio in Text mithilfe von KI-Diensten wie OpenAI Whisper API (0,006 USD pro Minute), Google Cloud Speech-to-Text (0,016 USD pro Minute für Standardmodelle), AWS Transcribe (0,024 USD pro Minute), Deepgram (0,0043 USD pro Minute für Nova-2) und AssemblyAI (0,0065 USD pro Minute). Diese Dienste wandeln gesprochene Sprache je nach Audioqualität, Sprache und Modellauswahl mit einer Genauigkeit von 90 bis 98 Prozent in geschriebenen Text um. Dieser Rechner dient Podcast-Produktionsfirmen, Callcenter-Analyseteams, juristischen Transkriptionsdiensten, Medienunternehmen, die Videoinhalte untertiteln, und Produktivitätstools für Meetings, die automatisierte Transkripte erstellen. Die Transkription einer 60-minütigen Podcast-Episode mit Whisper API kostet 0,36 $, mit Google Speech 0,96 $ oder mit Deepgram 0,26 $. In der Größenordnung verschärfen sich diese Unterschiede erheblich: Ein Callcenter, das 10.000 Anrufstunden pro Monat transkribiert, würde mit Whisper 3.600 US-Dollar, mit Google 9.600 US-Dollar oder mit Deepgram 2.580 US-Dollar zahlen. Über die grundlegenden Transkriptionskosten hinaus berücksichtigt der Rechner auch Funktionen, die sich auf die Preisgestaltung auswirken: Sprecherdiarisierung (Identifizierung, wer was gesagt hat), Echtzeit- oder Stapelverarbeitung (Echtzeit kostet normalerweise zwei- bis dreimal mehr), spezielle Vokabelmodelle und Nachbearbeitungskosten für Formatierung, Satzzeicheneinfügung und Absatzsegmentierung. Das Verständnis des gesamten Kostenstapels hilft Teams dabei, den richtigen Service für ihre Genauigkeitsanforderungen und Budgetbeschränkungen auszuwählen.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Formel
▾
Transkriptionskosten = Audiodauer in Minuten x Preis pro Minute. Für die Stapelverarbeitung von 500 Stunden Audio pro Monat auf Whisper API: Kosten = 500 x 60 x 0,006 $ = 180,00 $ pro Monat. Für Echtzeit-Transkription in Google Cloud mit 2-facher Rate: Kosten = 500 x 60 x 0,032 $ = 960,00 $.Variablenbeschreibung
▾
| Symbol | Name | Einheit | Beschreibung |
|---|---|---|---|
| D | Audiodauer | minutes | Gesamter zu transkribierender Audioinhalt, gemessen in Minuten, wobei die typische Sprache 130 bis 160 Wörter pro Minute umfasst. |
| P | Preis pro Minute | USD per minute | Der Preis für den Transkriptionsdienst pro Minute Audio reicht von 0,0043 $ für Deepgram bis 0,024 $ für AWS Transcribe. |
| R_stream | Streaming-Multiplikator | ratio (1.5 to 3.0) | Der Kostenmultiplikator für Echtzeit-Streaming-Transkription im Vergleich zur Stapelverarbeitung, der angewendet wird, wenn Ergebnisse mit geringer Latenz erforderlich sind. |
| T_review | Überprüfungszeit pro Audiostunde | minutes | Pro Stunde transkribierter Audiodaten ist eine menschliche Überprüfung und Korrekturzeit erforderlich, typischerweise 10 bis 30 Minuten, abhängig von den Genauigkeitsanforderungen. |
| H | Stundensatz für Gutachter | USD per hour | Die Kosten für menschliche Redakteure, die KI-Transkriptionen überprüfen und korrigieren, liegen je nach Fachwissen zwischen 25 und 75 US-Dollar pro Stunde. |
Anleitung Speech-to-Text API Cost Calculator
▾
- 1Bestimmen Sie die gesamte Audiodauer für die Transkription pro Monat. Messen Sie in Minuten oder Stunden und unterscheiden Sie zwischen vorab aufgezeichnetem (Batch) und Live-Audio (Echtzeit). Die Batch-Transkription ist in der Regel kostengünstiger und kann längere Bearbeitungszeiten in Kauf nehmen. Die Echtzeit-Transkription liefert Ergebnisse als Audio-Streams, kostet jedoch aufgrund der Rechenintensität der Verarbeitung mit geringer Latenz das 1,5- bis 3-fache.
- 2Wählen Sie Ihren Transkriptionsdienst basierend auf Genauigkeitsanforderungen, Sprachunterstützung und Budget aus. Whisper API bietet mit 0,006 $ pro Minute das beste Preis-Leistungs-Verhältnis für die meisten Sprachen. Deepgram Nova-2 ist mit 0,0043 $ pro Minute und wettbewerbsfähiger Genauigkeit die günstigste Option. Google Cloud und AWS bieten die umfassendste Sprachunterstützung und Integration in ihre jeweiligen Cloud-Ökosysteme. AssemblyAI bietet die besten Funktionen zur Sprecheraufzeichnung und Inhaltsanalyse.
- 3Konfigurieren Sie Transkriptionsfunktionen, die sich auf die Preisgestaltung auswirken. Die Sprechertagebücher (Identifizierung verschiedener Sprecher) erhöhen auf den meisten Plattformen die Grundkosten für die Transkription um 10 bis 30 Prozent. Interpunktion und Großschreibung sind in modernen Diensten standardmäßig enthalten. Echtzeit-Streaming kostet zwei- bis dreimal mehr als die Stapelverarbeitung. Für benutzerdefiniertes Vokabular oder branchenspezifische Modelle können auf einigen Plattformen zusätzliche Kosten anfallen.
- 4Berechnen Sie die Grundkosten für die Transkription, indem Sie die gesamten Audiominuten mit dem Minutenpreis multiplizieren. Berechnen Sie für gemischte Echtzeit- und Batch-Workloads jeweils separat: Batch-Audio mit der Standardrate und Echtzeit-Audio mit der erhöhten Rate. Addieren Sie die beiden, um die gesamten monatlichen Transkriptionskosten zu erhalten.
- 5Fügen Sie ggf. Nachbearbeitungskosten hinzu. Die Ausgabe der Rohtranskription erfordert häufig Formatierungen: Absatzumbrüche, Sprecherbezeichnungen, Einfügen von Zeitstempeln, Entfernen von Füllwörtern und domänenspezifische Korrekturen. Die automatisierte Nachbearbeitung mit einem LLM (GPT-4o-mini) kostet etwa 0,001 bis 0,005 US-Dollar pro verarbeiteter Audiominute. Die manuelle Nachbearbeitung durch einen menschlichen Redakteur kostet je nach erforderlicher Genauigkeit 0,50 bis 2,00 US-Dollar pro Audiominute.
- 6Berücksichtigen Sie die Speicherkosten für Audiodateien und Transkripte. Audiodateien mit 128 kbit/s verbrauchen etwa 1 MB pro Minute. Der Transkripttext ist von vernachlässigbarer Größe. Cloud-Speicher für 0,02 US-Dollar pro GB und Monat bedeutet, dass die Speicherung von 10.000 Stunden Audio (600 GB) 12 US-Dollar pro Monat kostet. Wenn Sie Audio aus Compliance-Gründen aufbewahren müssen, berücksichtigen Sie diese laufenden Speicherkosten.
- 7Vergleichen Sie die Gesamtkosten mit denen menschlicher Transkriptionsdienste. Eine professionelle menschliche Transkription kostet 1,00 bis 3,00 US-Dollar pro Audiominute für die Standardbearbeitung und 2,00 bis 5,00 US-Dollar für die Eilzustellung. Die KI-Transkription ist mit 0,004 bis 0,024 US-Dollar pro Minute 40- bis 750-mal günstiger. Auch wenn die Qualitätsprüfung durch Menschen 0,25 bis 0,50 US-Dollar pro Minute kostet, bleibt die KI-gestützte Transkription 50 bis 85 Prozent günstiger als die vollständig manuelle Transkription.
Gelöste Beispiele
▾
40 Episoden à 60 Minuten, insgesamt 2.400 Audiominuten. Bei 0,006 $ pro Minute betragen die monatlichen Kosten 14,40 $. Dies ersetzt einen menschlichen Transkriptionsdienst, der für das gleiche Volumen 2.400 bis 7.200 US-Dollar pro Monat verlangen würde. Die Kostenreduzierung um 99 Prozent macht die vollständige Transkription für jede Episode wirtschaftlich rentabel.
5.000 Stunden (300.000 Minuten) Anruftranskription in Echtzeit mit Sprecheraufzeichnung für 0,0059 $ pro Minute. Die Preise für Deepgram-Streaming beinhalten die Diarisierung. Dies ermöglicht Agentenunterstützung in Echtzeit und Analysen nach dem Anruf für Compliance und Qualitätssicherung zu einem Bruchteil der Kosten, die für dedizierte QS-Analysten anfallen.
30 Aussagen à 120 Minuten, insgesamt 3.600 Audiominuten. Die KI-Transkription kostet 23,40 $. Eine menschliche Überprüfung mit 15 Minuten pro Audiostunde (insgesamt 900 Stunden Überprüfungszeit) kostet 60 $/Stunde und kostet zusätzlich 450 $. Der Gesamtbetrag beträgt 473,40 US-Dollar im Vergleich zu 7.200 bis 14.400 US-Dollar für eine vollständig menschliche Transkription durch einen Gerichtsberichterstatter.
200 Videos à 15 Minuten, insgesamt 3.000 Audiominuten. Die Transkription kostet 0,016 $ pro Minute und kostet 48,00 $, zuzüglich der Untertitelformatierung für 0,002 $ pro Minute kommen 6,00 $ hinzu. Die ADA-konforme Untertitelung für 200 Videos für 54 US-Dollar pro Monat macht die Barrierefreiheit für Content-Ersteller jeder Größe erschwinglich.
Praktische Anwendungen
▾
Podcast-Hosting-Plattformen bieten die automatische Transkription als Premium-Funktion an. Eine Plattform, die 10.000 Podcasts mit durchschnittlich 4 Episoden pro Monat zu je 45 Minuten hostet, transkribiert monatlich 1,8 Millionen Audiominuten. Bei Verwendung der Whisper API für 0,006 $ pro Minute betragen die monatlichen Kosten 10.800 $. Die Funktion wird Podcast-Erstellern als Premium-Funktion mit 5 US-Dollar pro Monat in Rechnung gestellt und generiert bei 3.000 Abonnenten einen Umsatz von 15.000 US-Dollar. Sie ist profitabel und bietet gleichzeitig Zugänglichkeit und SEO-Vorteile.
Gesundheitsorganisationen transkribieren Arzt-Patienten-Begegnungen zur Dokumentation von Krankenakten. Ein Krankenhausnetzwerk mit 500 Ärzten und durchschnittlich 20 Patientenkontakten pro Tag zu je 15 Minuten erzeugt 150.000 Audiominuten pro Monat. Die Nutzung eines HIPAA-konformen Dienstes für 0,01 US-Dollar pro Minute kostet 1.500 US-Dollar pro Monat. Medizinische Kodierer überprüfen Transkripte in 5 Minuten pro Begegnung und kosten 30 US-Dollar pro Stunde, was einem monatlichen Zuschlag von 25.000 US-Dollar entspricht. Die Gesamtkosten von 26.500 US-Dollar ersetzen 75.000 US-Dollar pro Monat für die manuelle medizinische Transkription.
Medienunternehmen beschriften Videoinhalte aus Gründen der Barrierefreiheit und SEO. Eine Streaming-Plattform mit 5.000 Stunden neuen Inhalten pro Monat nutzt Google Cloud Speech für 0,016 US-Dollar pro Minute, was monatlich 4.800 US-Dollar für die Transkription kostet. Durch die automatische Formatierung der Untertitel fallen zusätzliche 600 US-Dollar an. Die Überprüfung durch menschliche Qualitätssicherung bei 10 Minuten pro Inhaltsstunde kostet zusätzlich 8.333 US-Dollar. Die Gesamtkosten für die Untertitelung betragen 13.733 US-Dollar pro Monat im Vergleich zu 50.000 bis 100.000 US-Dollar für manuelle Untertitelungsdienste.
Marktforschungsunternehmen transkribieren Fokusgruppen und Kundeninterviews. Eine Firma, die 200 Interviews pro Monat zu je 45 Minuten durchführt, nutzt AssemblyAI mit Sprechertagebüchern für 0,0065 US-Dollar pro Minute, was 58,50 US-Dollar pro Monat für die Transkription kostet. Forscher verbringen 10 Minuten pro Interview mit der Durchsicht und Kommentierung von Transkripten, was 75 US-Dollar pro Stunde kostet, was einem Zuschlag von 2.500 US-Dollar entspricht. Die monatlichen Kosten von 2.558,50 US-Dollar ermöglichen eine schnelle Analyse, für die zuvor 8.000 US-Dollar pro Monat spezielles Transkriptionspersonal erforderlich war.
Sonderfälle
▾
Für eine HIPAA-konforme medizinische Transkription sind nicht alle Dienste berechtigt.
Google Cloud Speech, AWS Transcribe und Azure Speech bieten HIPAA-konforme Konfigurationen mit Business Associate Agreements. OpenAI Whisper API und Deepgram bieten Unternehmensvereinbarungen mit Compliance-Zertifizierungen. Selbst gehostetes Whisper auf einer HIPAA-konformen Infrastruktur bietet die größte Kontrolle, erfordert jedoch spezielles Sicherheits- und Compliance-Know-how. Die medizinische Transkription profitiert auch von benutzerdefinierten Vokabelmodellen, die auf der medizinischen Terminologie basieren.
Zum Transkribieren von Audio in lauten Umgebungen (Baustellen, Restaurants,
Beim Transkribieren von Audio in lauten Umgebungen (Baustellen, Restaurants, Veranstaltungen im Freien) kann die Genauigkeit selbst bei den besten Modellen auf 60 bis 75 Prozent sinken. Durch die Vorverarbeitung mit Rauschunterdrückungstools wie RNNoise oder DeepFilterNet kann die Genauigkeit bei vernachlässigbarem Rechenaufwand um 10 bis 20 Prozentpunkte verbessert werden. Bei extrem verrauschten Audiodaten ist ein Zwei-Durchgangs-Ansatz (Rauschunterdrückung gefolgt von Transkription) genauer und letztendlich kostengünstiger als die menschliche Korrektur minderwertiger Transkripte.
Zur Archivtranskription historischer Tonaufnahmen (analoge Aufnahmen,
Bei der archivierten Transkription historischer Audioaufnahmen (analoge Aufnahmen, alte Telefonsysteme, beschädigte Tonbänder) kommen Probleme mit der Audioqualität hinzu, die mit den technischen Einschränkungen älterer Modelle einhergehen. Diese Aufnahmen können niedrige Abtastraten (8-kHz-Telefon), erhebliche Hintergrundgeräusche und veraltetes Vokabular aufweisen. Eine spezielle Vorverarbeitung zum Upsampling und Entrauschen des Audios kann in Kombination mit fein abgestimmten Modellen für die spezifische Audioqualität die Genauigkeit von 50 bis 60 Prozent (Standardmodelle) auf 80 bis 90 Prozent verbessern, bei zusätzlichen Vorverarbeitungskosten von 0,002 bis 0,01 US-Dollar pro Minute.
Preisvergleich für Speech-to-Text-Dienste (2025)
▾
| Service | Chargenpreis/Min | Streaming-Preis/Min | Diarisierung | Sprachen | Kostenloses Kontingent |
|---|---|---|---|---|---|
| OpenAI Whisper-API | 0,006 $ | N/A | No | 99+ | No |
| Deepgram Nova-2 | 0,0043 $ | 0,0059 $ | Ja (0,0049 $) | 36+ | 12.000 Min |
| AssemblyAI | 0,0065 $ | 0,0085 $ | Ja (im Lieferumfang enthalten) | 20+ | 100 Std |
| Google Cloud Speech | 0,016 $ | 0,032 $ | Ja (0,02 $) | 125+ | 60 Min./Monat |
| AWS Transkribieren | 0,024 $ | 0,024 $ | Ja (im Lieferumfang enthalten) | 100+ | 60 Min./Monat (12 Monate) |
| Azure Speech | 0,016 $ | 0,016 $ | Ja (0,02 $) | 100+ | 5 Std./Monat |
Häufig gestellte Fragen
▾
Welcher Speech-to-Text-Dienst ist am genauesten?
Für Englisch erreichen OpenAI Whisper und Deepgram Nova-2 die höchste Genauigkeit mit einer Wortfehlerrate von 95 bis 98 Prozent bei sauberem Audio. Google Cloud Speech und AWS Transcribe sind mit 93 bis 97 Prozent vergleichbar. Für spezielle Bereiche (Medizin, Recht, Finanzen) können benutzerdefinierte Vokabularmodelle in Google Cloud oder AWS die Genauigkeit um 3 bis 5 Prozentpunkte verbessern. Bei lautem Ton, starken Akzenten oder mehrsprachigen Inhalten sinkt die Genauigkeit um 5 bis 15 Prozentpunkte.
Wie schneidet Whisper API im Vergleich zu selbst gehostetem Whisper ab?
OpenAI Whisper API für 0,006 $ pro Minute ist ein verwalteter Dienst ohne zu verwaltende Infrastruktur. Selbstgehostetes Whisper auf einer Cloud-GPU (A10G für 1,10 $/Std.) verarbeitet Audio mit etwa der 10- bis 30-fachen Echtzeitgeschwindigkeit und kostet bei voller Auslastung 0,001 bis 0,002 $ pro Minute. Selbsthosting ist drei- bis sechsmal günstiger, erfordert jedoch GPU-Verwaltung, Skalierung und Überwachung. Der Break-Even liegt bei etwa 5.000 bis 10.000 Audiominuten pro Monat.
Was ist der Unterschied zwischen Batch- und Echtzeit-Transkription?
Die Batch-Transkription verarbeitet vorab aufgezeichnete Audiodateien und liefert Ergebnisse innerhalb von Minuten bis Stunden. Die Transkription in Echtzeit (Streaming) verarbeitet Audiodaten bereits bei der Aufnahme und gibt Wörter innerhalb von 200 bis 500 ms nach dem Sprechen zurück. Batch ist 1,5- bis 3-mal günstiger und eignet sich für aufgezeichnete Inhalte. Echtzeit ist für die Live-Untertitelung, die Transkription von Besprechungen und die Unterstützung von Call-Center-Agenten unerlässlich. Die meisten Anbieter bieten beide Modi an.
Wie genau ist die KI-Transkription für Meetings mit mehreren Rednern?
Moderne Dienste erreichen eine Genauigkeit von 90 bis 95 Prozent bei Besprechungen mit klarer Abwechslung zwischen 2 und 4 Rednern. Bei überlappender Sprache, mehr als 6 Sprechern oder schlechter Mikrofonqualität sinkt die Genauigkeit auf 80 bis 90 Prozent. Die Tagebuchaufzeichnung der Sprecher (Identifizierung, wer was gesagt hat) ist bei gut getrennten Sprechern zu 85 bis 95 Prozent genau, kann in chaotischen Besprechungsumgebungen jedoch unter 80 Prozent fallen. Der Einsatz hochwertiger Mikrofone und Aufnahme-Setups verbessert die Ergebnisse deutlich.
Kann ich in anderen Sprachen als Englisch transkribieren?
Ja, alle wichtigen Dienste unterstützen mehrere Sprachen. Whisper unterstützt über 99 Sprachen mit unterschiedlicher Genauigkeit. Google Cloud unterstützt mehr als 125 Sprachen. Die Genauigkeit für nicht-englische Sprachen ist in der Regel 3 bis 10 Prozentpunkte niedriger als für Englisch. Für Tonsprachen wie Mandarin und Thai bieten spezielle Modelle eine bessere Genauigkeit. Die Kosten pro Minute sind im Allgemeinen unabhängig von der Sprache gleich, obwohl einige Dienste für weniger verbreitete Sprachen einen Aufpreis verlangen.
Häufige Fehler vermeiden
▾
- !Verwenden von Echtzeitpreisen für Batch-Workloads:
- !Ohne Berücksichtigung der Auswirkungen der Audioqualität auf die Genauigkeit:
- !Ignorieren der Kosten für die Sprecherdiagnose bei Audio mit mehreren Sprechern:
Profi-Tipp
Für maximale Kosteneffizienz bei großen Transkriptions-Workloads können Sie Whisper selbst auf einer Cloud-GPU mit automatischer Skalierung hosten. Eine A10G-GPU für 1,10 US-Dollar pro Stunde transkribiert Audio mit etwa der 15-fachen Echtzeitgeschwindigkeit und kostet etwa 0,001 US-Dollar pro Minute. Richten Sie eine Warteschlange mit automatischer Skalierung ein, die GPUs hochfährt, wenn Audiodateien übermittelt werden, und herunterfährt, wenn die Warteschlange leer ist. Dieser Ansatz spart 70 bis 85 Prozent im Vergleich zur Whisper-API und verarbeitet gleichzeitig variable Arbeitslasten effizient.
Wussten Sie?
OpenAI Whisper wurde mit 680.000 Stunden mehrsprachigem Audio trainiert, was 77 Jahren ununterbrochenem Hören entspricht. Obwohl die Whisper API im Jahr 2022 als Open-Source-Modell veröffentlicht wird, bleibt sie einer der beliebtesten Transkriptionsdienste, da der Komfort des API-Zugriffs für die meisten Unternehmen die Kosteneinsparungen durch Selbsthosting überwiegt.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
Holen Sie sich wöchentliche Mathe-Tipps
Schließen Sie sich 12.000+-Abonnenten an, die jede Woche Taschenrechner-Tipps erhalten.