Apa itu Speech-to-Text API Cost Calculator?
▾
Kalkulator Biaya Ucapan-ke-Teks memperkirakan biaya transkripsi audio menjadi teks menggunakan layanan AI termasuk OpenAI Whisper API ($0,006 per menit), Google Cloud Speech-to-Text ($0,016 per menit untuk model standar), AWS Transcribe ($0,024 per menit), Deepgram ($0,0043 per menit untuk Nova-2), dan AssemblyAI ($0,0065 per menit). Layanan ini mengubah bahasa lisan menjadi teks tertulis dengan akurasi 90 hingga 98 persen bergantung pada kualitas audio, bahasa, dan pemilihan model. Kalkulator ini melayani perusahaan produksi podcast, tim analisis pusat panggilan, layanan transkripsi legal, perusahaan media yang membuat teks konten video, dan alat produktivitas rapat yang menghasilkan transkrip otomatis. Episode podcast berdurasi 60 menit berharga $0,36 untuk ditranskripsikan dengan Whisper API, $0,96 dengan Google Speech, atau $0,26 dengan Deepgram. Dalam skala besar, perbedaan ini bertambah secara signifikan: pusat panggilan yang mencatat 10.000 jam panggilan per bulan akan membayar $3.600 dengan Whisper, $9.600 dengan Google, atau $2.580 dengan Deepgram. Selain biaya transkripsi dasar, kalkulator ini juga memperhitungkan fitur-fitur yang memengaruhi harga: diarisasi pembicara (mengidentifikasi siapa mengatakan apa), pemrosesan waktu nyata versus pemrosesan batch (waktu nyata biasanya biayanya 2 hingga 3 kali lebih mahal), model kosakata khusus, dan biaya pasca-pemrosesan untuk pemformatan, penyisipan tanda baca, dan segmentasi paragraf. Memahami keseluruhan biaya membantu tim memilih layanan yang tepat untuk kebutuhan akurasi dan batasan anggaran mereka.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Rumus
▾
Biaya Transkripsi = Durasi Audio dalam Menit x Harga per Menit. Untuk pemrosesan batch 500 jam audio per bulan di Whisper API: Biaya = 500 x 60 x $0,006 = $180,00 per bulan. Untuk transkripsi real-time di Google Cloud dengan tarif 2x: Biaya = 500 x 60 x $0,032 = $960,00.Keterangan variabel
▾
| Simbol | Nama | Satuan | Deskripsi |
|---|---|---|---|
| D | Durasi Audio | minutes | Total konten audio yang akan ditranskripsikan, diukur dalam hitungan menit, dengan rata-rata ucapan berisi 130 hingga 160 kata per menit. |
| P | Harga per Menit | USD per minute | Tarif layanan transkripsi per menit audio, mulai dari $0,0043 untuk Deepgram hingga $0,024 untuk AWS Transcribe. |
| R_stream | Pengganda Streaming | ratio (1.5 to 3.0) | Pengganda biaya untuk transkripsi streaming real-time versus pemrosesan batch, diterapkan ketika hasil latensi rendah diperlukan. |
| T_review | Tinjau Waktu per Jam Audio | minutes | Waktu peninjauan dan koreksi oleh manusia diperlukan per jam audio yang ditranskripsi, biasanya 10 hingga 30 menit bergantung pada persyaratan akurasi. |
| H | Tarif Per Jam Peninjau | USD per hour | Biaya editor manusia yang meninjau dan mengoreksi transkripsi AI, berkisar antara $25 hingga $75 per jam bergantung pada keahlian domain. |
Cara Speech-to-Text API Cost Calculator
▾
- 1Tentukan total durasi audio yang akan ditranskripsi per bulan. Ukur dalam hitungan menit atau jam dan bedakan antara audio yang direkam sebelumnya (batch) dan audio langsung (waktu nyata). Transkripsi batch biasanya lebih murah dan menerima waktu pemrosesan yang lebih lama. Transkripsi real-time memberikan hasil sebagai aliran audio tetapi biayanya 1,5 hingga 3 kali lebih mahal karena intensitas komputasi pemrosesan latensi rendah.
- 2Pilih layanan transkripsi Anda berdasarkan persyaratan akurasi, dukungan bahasa, dan anggaran. Whisper API menawarkan rasio harga terhadap kualitas terbaik untuk sebagian besar bahasa dengan harga $0,006 per menit. Deepgram Nova-2 adalah opsi termurah dengan harga $0,0043 per menit dengan akurasi kompetitif. Google Cloud dan AWS menawarkan dukungan bahasa terluas dan integrasi dengan ekosistem cloud masing-masing. MajelisAI menyediakan fitur diarisasi pembicara dan analisis konten terbaik.
- 3Konfigurasikan fitur transkripsi yang memengaruhi harga. Diarisasi pembicara (mengidentifikasi pembicara yang berbeda) menambah 10 hingga 30 persen biaya transkripsi dasar di sebagian besar platform. Tanda baca dan kapitalisasi disertakan secara default pada layanan modern. Biaya streaming real-time 2 hingga 3 kali lebih mahal dibandingkan pemrosesan batch. Kosakata khusus atau model khusus industri mungkin dikenakan biaya tambahan pada beberapa platform.
- 4Hitung biaya transkripsi dasar dengan mengalikan total menit audio dengan tarif per menit. Untuk beban kerja campuran real-time dan batch, hitung masing-masing secara terpisah: audio batch pada kecepatan standar dan audio real-time pada kecepatan tinggi. Jumlahkan keduanya untuk total biaya transkripsi bulanan.
- 5Tambahkan biaya pasca pemrosesan jika berlaku. Keluaran transkripsi mentah sering kali memerlukan pemformatan: jeda paragraf, label pembicara, penyisipan stempel waktu, penghapusan kata pengisi, dan koreksi khusus domain. Pasca-pemrosesan otomatis menggunakan LLM (GPT-4o-mini) menghabiskan biaya sekitar $0,001 hingga $0,005 per menit audio yang diproses. Pasca-pemrosesan manual oleh editor manusia berharga $0,50 hingga $2,00 per menit audio, bergantung pada akurasi yang diperlukan.
- 6Pertimbangkan biaya penyimpanan untuk file audio dan transkrip. File audio pada 128 kbps mengkonsumsi sekitar 1 MB per menit. Ukuran teks transkrip dapat diabaikan. Penyimpanan cloud seharga $0,02 per GB per bulan berarti 10.000 jam audio (600 GB) berharga $12 per bulan untuk disimpan. Jika Anda perlu menyimpan audio untuk mematuhi kepatuhan, sertakan biaya penyimpanan berkelanjutan ini.
- 7Bandingkan total biaya dengan layanan transkripsi manusia. Transkripsi manusia profesional berharga $1,00 hingga $3,00 per menit audio untuk penyelesaian standar dan $2,00 hingga $5,00 untuk pengiriman terburu-buru. Transkripsi AI dengan harga $0,004 hingga $0,024 per menit adalah 40 hingga 750 kali lebih murah. Bahkan dengan tinjauan kualitas manusia yang menambahkan $0,25 hingga $0,50 per menit, transkripsi yang dibantu AI tetap 50 hingga 85 persen lebih murah dibandingkan transkripsi manual sepenuhnya.
Contoh Terpecahkan
▾
40 episode berdurasi 60 menit masing-masing total 2.400 menit audio. Dengan $0,006 per menit, biaya bulanannya adalah $14,40. Ini menggantikan layanan transkripsi manusia yang akan mengenakan biaya $2.400 hingga $7.200 per bulan untuk volume yang sama. Pengurangan biaya sebesar 99 persen membuat transkripsi penuh layak secara ekonomi untuk setiap episode.
5.000 jam (300.000 menit) transkripsi panggilan real-time dengan diarisasi speaker seharga $0,0059 per menit. Harga streaming Deepgram sudah termasuk diarisasi. Hal ini memungkinkan bantuan agen real-time dan analisis pasca-panggilan untuk kepatuhan dan jaminan kualitas dengan biaya yang lebih murah dari analis QA khusus.
30 deposisi pada masing-masing 120 menit total 3.600 menit audio. Transkripsi AI berharga $23,40. Peninjauan manusia dengan durasi 15 menit per jam audio (total waktu peninjauan 900 jam) dengan biaya $60/jam menambahkan $450. Totalnya adalah $473,40 versus $7,200 hingga $14,400 untuk transkripsi reporter pengadilan manusia sepenuhnya.
200 video berdurasi 15 menit masing-masing total 3.000 menit audio. Transkripsi dengan harga $0,016 per menit adalah $48,00, ditambah pemformatan teks dengan harga $0,002 per menit akan menambah $6,00. Pembuatan teks sesuai kepatuhan ADA untuk 200 video dengan harga $54 per bulan menjadikan aksesibilitas terjangkau bagi pembuat konten dari semua ukuran.
Aplikasi nyata
▾
Platform hosting podcast menawarkan transkripsi otomatis sebagai fitur premium. Sebuah platform yang menghosting 10.000 podcast dengan rata-rata 4 episode per bulan dengan durasi masing-masing 45 menit mentranskripsikan 1,8 juta menit audio setiap bulan. Menggunakan Whisper API seharga $0,006 per menit, biaya bulanannya adalah $10.800. Dikenakan biaya $5 per bulan kepada pembuat podcast sebagai fitur premium, dengan 3.000 pelanggan menghasilkan pendapatan $15.000, fitur ini menguntungkan sekaligus memberikan manfaat aksesibilitas dan SEO.
Organisasi layanan kesehatan mentranskripsikan pertemuan dokter-pasien untuk dokumentasi rekam medis. Jaringan rumah sakit dengan 500 dokter yang rata-rata bertemu dengan 20 pasien per hari dengan durasi 15 menit, masing-masing menghasilkan 150.000 menit audio per bulan. Menggunakan layanan yang sesuai dengan HIPAA dengan biaya $0,01 per menit adalah $1.500 per bulan. Pembuat kode medis meninjau transkrip dalam 5 menit per pertemuan dengan biaya $30 per jam, menambahkan $25.000 setiap bulan. Total biaya $26.500 menggantikan $75.000 per bulan dalam transkripsi medis manual.
Perusahaan media memberi teks pada konten video untuk kepatuhan aksesibilitas dan SEO. Platform streaming dengan 5.000 jam konten baru per bulan menggunakan Google Cloud Speech dengan biaya $0,016 per menit, dengan biaya transkripsi $4.800 per bulan. Pemformatan teks otomatis menambahkan $600. Tinjauan QA manusia dalam 10 menit per jam konten menambahkan $8.333. Total biaya pembuatan teks sebesar $13.733 per bulan dibandingkan dengan $50.000 hingga $100.000 untuk layanan pembuatan teks manual.
Perusahaan riset pasar menuliskan kelompok fokus dan wawancara pelanggan. Sebuah perusahaan yang melakukan 200 wawancara per bulan dengan durasi masing-masing 45 menit menggunakan AssemblyAI dengan diarisasi pembicara seharga $0,0065 per menit, dengan biaya transkripsi $58,50 per bulan. Peneliti menghabiskan 10 menit per wawancara untuk meninjau dan membuat anotasi transkrip dengan biaya $75 per jam, ditambah $2.500. Biaya bulanan sebesar $2.558,50 memungkinkan analisis cepat yang sebelumnya memerlukan staf transkripsi khusus dengan biaya $8.000 per bulan.
Kasus khusus
▾
Untuk transkripsi medis yang sesuai dengan HIPAA, tidak semua layanan memenuhi syarat.
Google Cloud Speech, AWS Transcribe, dan Azure Speech menawarkan konfigurasi yang sesuai dengan HIPAA dengan Perjanjian Rekan Bisnis. OpenAI Whisper API dan Deepgram menawarkan perjanjian perusahaan dengan sertifikasi kepatuhan. Whisper yang dihosting sendiri di infrastruktur yang sesuai dengan HIPAA memberikan kontrol paling besar tetapi memerlukan keahlian keamanan dan kepatuhan khusus. Transkripsi medis juga mendapat manfaat dari model kosakata khusus yang dilatih tentang terminologi medis.
Untuk menyalin audio di lingkungan yang bising (lokasi konstruksi, restoran,
Untuk menyalin audio di lingkungan yang bising (lokasi konstruksi, restoran, acara luar ruangan), akurasi dapat turun hingga 60 hingga 75 persen bahkan dengan model terbaik. Pra-pemrosesan dengan alat pengurangan kebisingan seperti RNNoise atau DeepFilterNet dapat meningkatkan akurasi sebesar 10 hingga 20 poin persentase dengan biaya komputasi yang dapat diabaikan. Untuk audio yang sangat bising, pendekatan dua jalur (pengurangan noise diikuti dengan transkripsi) lebih akurat dan pada akhirnya lebih murah daripada mengandalkan koreksi manusia terhadap transkrip berkualitas rendah.
Untuk transkripsi arsip rekaman audio historis (rekaman analog,
Untuk transkripsi arsip rekaman audio historis (rekaman analog, sistem telepon lama, tape yang rusak), masalah kualitas audio ditambah dengan keterbatasan teknologi pada model lama. Rekaman ini mungkin memiliki kecepatan sampel yang rendah (telepon 8kHz), kebisingan latar belakang yang signifikan, dan kosakata yang ketinggalan jaman. Pra-pemrosesan khusus untuk meningkatkan sampel dan menghilangkan kebisingan audio, dikombinasikan dengan model yang disempurnakan untuk kualitas audio tertentu, dapat meningkatkan akurasi dari 50 hingga 60 persen (model standar) menjadi 80 hingga 90 persen, dengan biaya pra-pemrosesan tambahan sebesar $0,002 hingga $0,01 per menit.
Perbandingan Harga Layanan Ucapan-ke-Teks (2025)
▾
| Melayani | Harga Batch/Min | Harga Streaming/Min | Diarisasi | Bahasa | Tingkat Gratis |
|---|---|---|---|---|---|
| API Bisikan OpenAI | $0,006 | N/A | No | 99+ | No |
| Deepgram Nova-2 | $0,0043 | $0,0059 | Ya ($0,0049) | 36+ | 12.000 menit |
| MajelisAI | $0,0065 | $0,0085 | Ya (termasuk) | 20+ | 100 jam |
| Pidato Google Cloud | $0,016 | $0,032 | Ya ($0,02) | 125+ | 60 mnt/bln |
| AWS Transkrip | $0,024 | $0,024 | Ya (termasuk) | 100+ | 60 menit/bln (12 bulan) |
| Pidato Azure | $0,016 | $0,016 | Ya ($0,02) | 100+ | 5 jam/bln |
Pertanyaan yang sering diajukan
▾
Layanan ucapan-ke-teks manakah yang paling akurat?
Untuk bahasa Inggris, OpenAI Whisper dan Deepgram Nova-2 mencapai akurasi tertinggi pada tingkat kesalahan kata 95 hingga 98 persen pada audio yang bersih. Google Cloud Speech dan AWS Transcribe sebanding pada 93 hingga 97 persen. Untuk domain khusus (medis, hukum, keuangan), model kosakata khusus di Google Cloud atau AWS dapat meningkatkan akurasi sebesar 3 hingga 5 poin persentase. Akurasi turun 5 hingga 15 poin persentase untuk audio berisik, aksen berat, atau konten multibahasa.
Bagaimana Whisper API dibandingkan dengan Whisper yang dihosting sendiri?
OpenAI Whisper API seharga $0,006 per menit adalah layanan terkelola tanpa infrastruktur untuk dikelola. Whisper yang dihosting sendiri di GPU cloud (A10G seharga $1,10/jam) memproses audio dengan kecepatan sekitar 10 hingga 30 kali waktu nyata, dengan biaya $0,001 hingga $0,002 per menit pada penggunaan penuh. Hosting mandiri 3 hingga 6 kali lebih murah tetapi memerlukan manajemen GPU, penskalaan, dan pemantauan. Titik impasnya adalah sekitar 5.000 hingga 10.000 menit audio per bulan.
Apa perbedaan antara transkripsi batch dan real-time?
Transkripsi batch memproses file audio yang direkam sebelumnya dan mengembalikan hasilnya dalam hitungan menit hingga jam. Transkripsi (streaming) real-time memproses audio saat ditangkap dan mengembalikan kata-kata dalam waktu 200 hingga 500 ms setelah diucapkan. Batch 1,5 hingga 3 kali lebih murah dan cocok untuk konten rekaman. Waktu nyata sangat penting untuk pembuatan teks langsung, transkripsi rapat, dan bantuan agen pusat panggilan. Sebagian besar penyedia menawarkan kedua mode tersebut.
Seberapa akurat transkripsi AI untuk rapat dengan banyak pembicara?
Layanan modern mencapai akurasi 90 hingga 95 persen untuk rapat dengan pergantian giliran yang jelas antara 2 hingga 4 pembicara. Akurasi turun hingga 80 hingga 90 persen jika ucapan tumpang tindih, lebih dari 6 speaker, atau kualitas mikrofon buruk. Diarisasi pembicara (mengidentifikasi siapa yang mengatakan apa) memiliki akurasi 85 hingga 95 persen untuk pembicara yang berjauhan, namun bisa turun di bawah 80 persen dalam lingkungan pertemuan yang kacau. Menggunakan mikrofon berkualitas tinggi dan pengaturan perekaman akan meningkatkan hasil secara signifikan.
Bisakah saya menyalin dalam bahasa selain bahasa Inggris?
Ya, semua layanan utama mendukung berbagai bahasa. Whisper mendukung 99+ bahasa dengan akurasi yang bervariasi. Google Cloud mendukung 125+ bahasa. Akurasi untuk bahasa non-Inggris biasanya 3 hingga 10 poin persentase lebih rendah dibandingkan bahasa Inggris. Untuk bahasa bernada seperti Mandarin dan Thailand, model khusus menawarkan akurasi yang lebih baik. Biaya per menit pada umumnya sama, apa pun bahasanya, meskipun beberapa layanan mengenakan biaya premium untuk bahasa yang kurang umum.
Kesalahan Umum yang Harus Dihindari
▾
- !Menggunakan Penetapan Harga Real-Time untuk Beban Kerja Batch:
- !Tidak Memperhitungkan Dampak Kualitas Audio terhadap Akurasi:
- !Mengabaikan Biaya Diarisasi Speaker untuk Audio Multi-Speaker:
Tip Pro
Untuk efisiensi biaya maksimum pada beban kerja transkripsi yang besar, host mandiri Whisper di GPU cloud dengan penskalaan otomatis. GPU A10G seharga $1,10 per jam mentranskripsikan audio sekitar 15 kali kecepatan real-time, dengan biaya sekitar $0,001 per menit. Siapkan antrean penskalaan otomatis yang memutar GPU saat file audio dikirimkan dan mematikannya saat antrean kosong. Pendekatan ini menghemat 70 hingga 85 persen dibandingkan Whisper API sekaligus menangani beban kerja variabel secara efisien.
Tahukah Anda?
OpenAI Whisper dilatih dengan audio multibahasa selama 680.000 jam, setara dengan mendengarkan tanpa henti selama 77 tahun. Meskipun dirilis sebagai model sumber terbuka pada tahun 2022, Whisper API tetap menjadi salah satu layanan transkripsi paling populer karena kenyamanan akses API melebihi penghematan biaya hosting mandiri bagi sebagian besar organisasi.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
Dapatkan Tips Matematika Mingguan
Bergabunglah dengan pelanggan 12.000+ yang mendapatkan tip kalkulator setiap minggu.