とは何か Speech-to-Text API Cost Calculator?
▾
Speech-to-Text Cost Calculator は、OpenAI Whisper API (1 分あたり 0.006 ドル)、Google Cloud Speech-to-Text (標準モデルの場合は 1 分あたり 0.016 ドル)、AWS Transcribe (1 分あたり 0.024 ドル)、Deepgram (Nova-2 の場合は 1 分あたり 0.0043 ドル)、AssemblyAI (1 分あたり 0.0065 ドル) などの AI サービスを使用して音声をテキストに書き起こす費用を見積もります。これらのサービスは、音声の品質、言語、選択したモデルに応じて、話し言葉を 90 ~ 98% の精度で書き言葉に変換します。 この計算ツールは、ポッドキャスト制作会社、コールセンター分析チーム、法的文字起こしサービス、ビデオ コンテンツにキャプションを付けるメディア会社、および自動文字起こしを生成する会議生産性ツールに役立ちます。 60 分のポッドキャスト エピソードの文字起こしには、Whisper API の場合は 0.36 ドル、Google Speech の場合は 0.96 ドル、Deepgram の場合は 0.26 ドルかかります。大規模になると、これらの違いはさらに大きくなります。月あたり 10,000 時間の通話を文字起こしするコールセンターの場合、Whisper の場合は 3,600 ドル、Google の場合は 9,600 ドル、Deepgram の場合は 2,580 ドルを支払うことになります。 この計算ツールでは、基本的な文字起こしコストのほかに、価格に影響を与える機能、つまり話者ダイアライゼーション (誰が何を言ったかを特定する)、リアルタイム処理とバッチ処理 (通常、リアルタイムは 2 ~ 3 倍のコストがかかります)、特殊な語彙モデル、書式設定、句読点の挿入、段落分割などの後処理コストも考慮します。全体のコストスタックを理解することは、チームが精度要件と予算の制約に応じて適切なサービスを選択するのに役立ちます。
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
公式
▾
文字起こしコスト = 音声時間 (分) x 1 分あたりの料金。 Whisper API で月あたり 500 時間の音声をバッチ処理する場合: コスト = 500 x 60 x 0.006 ドル = 月あたり 180.00 ドル。 Google Cloud で 2 倍のレートでリアルタイム文字起こしを行う場合: コスト = 500 x 60 x 0.032 ドル = 960.00 ドル。変数の説明
▾
| 記号 | 名前 | 単位 | 説明 |
|---|---|---|---|
| D | 音声の長さ | minutes | 文字起こしする音声コンテンツの合計。分単位で測定されます。通常のスピーチでは、1 分あたり 130 ~ 160 ワードが含まれます。 |
| P | 1分あたりの料金 | USD per minute | 音声 1 分あたりの文字起こしサービス料金。範囲は、Deepgram の 0.0043 ドルから AWS Transcribe の 0.024 ドルです。 |
| R_stream | ストリーミング乗数 | ratio (1.5 to 3.0) | リアルタイム ストリーミング文字起こしとバッチ処理のコスト乗数。低遅延の結果が必要な場合に適用されます。 |
| T_review | オーディオ 1 時間あたりのレビュー時間 | minutes | 文字起こしされた音声 1 時間あたり人間によるレビューと修正に必要な時間は、精度要件に応じて通常 10 ~ 30 分です。 |
| H | レビュー担当者の時給 | USD per hour | AI 文字起こしをレビューして修正する人間の編集者のコストは、分野の専門知識に応じて 1 時間あたり 25 ドルから 75 ドルの範囲です。 |
方法 Speech-to-Text API Cost Calculator
▾
- 11 か月あたりに文字起こしする合計音声時間を決定します。分または時間単位で測定し、録音済み (バッチ) オーディオとライブ (リアルタイム) オーディオを区別します。通常、バッチ転写の方が安価であり、より長い処理時間も許容できます。リアルタイム文字起こしは結果をオーディオ ストリームとして提供しますが、低遅延処理の計算量が多いため、コストが 1.5 ~ 3 倍かかります。
- 2精度要件、言語サポート、予算に基づいて文字起こしサービスを選択してください。 Whisper API は、1 分あたり 0.006 ドルで、ほとんどの言語に対して最高の価格と品質の比率を提供します。 Deepgram Nova-2 は、競争力のある精度を備えた 1 分あたり 0.0043 ドルの最も安価なオプションです。 Google Cloud と AWS は、最も広範な言語サポートと、それぞれのクラウド エコシステムとの統合を提供します。 AssemblyAI は、最高の話者ダイアライゼーション機能とコンテンツ分析機能を提供します。
- 3価格に影響する文字起こし機能を構成します。話者ダイアライゼーション (異なる話者の識別) は、ほとんどのプラットフォームで基本的な文字起こしコストに 10 ~ 30% 追加されます。最新のサービスには、句読点と大文字の使用がデフォルトで含まれています。リアルタイム ストリーミングはバッチ処理よりも 2 ~ 3 倍のコストがかかります。一部のプラットフォームでは、カスタム語彙または業界固有のモデルに追加料金がかかる場合があります。
- 4合計音声時間に分あたりの料金を乗じて、基本的な文字起こしコストを計算します。リアルタイム ワークロードとバッチ ワークロードが混在している場合は、標準レートのバッチ オーディオと高いレートのリアルタイム オーディオというように、それぞれを個別に計算します。 2 つを合計すると、毎月のトランスクリプション費用の合計となります。
- 5必要に応じて後処理コストを追加します。生の文字起こし出力には、多くの場合、段落区切り、話者ラベル、タイムスタンプの挿入、フィラーワードの削除、ドメイン固有の修正などの書式設定が必要です。 LLM (GPT-4o-mini) を使用した自動後処理には、処理される音声 1 分あたり約 0.001 ドルから 0.005 ドルの費用がかかります。人間の編集者による手動の後処理には、必要な精度に応じて、音声 1 分あたり 0.50 ドルから 2.00 ドルの費用がかかります。
- 6音声ファイルとトランスクリプトのストレージ コストを考慮に入れてください。 128 kbps のオーディオ ファイルは 1 分あたり約 1 MB を消費します。転写テキストのサイズは無視できます。クラウド ストレージは月額 1 GB あたり 0.02 ドルで、10,000 時間のオーディオ (600 GB) を保存するには月額 12 ドルかかります。コンプライアンスのために音声を保持する必要がある場合は、この継続的なストレージ コストを含めてください。
- 7総コストを人間による文字起こしサービスと比較します。プロによる人間による文字起こしの費用は、標準納期の場合、音声 1 分あたり 1.00 ~ 3.00 ドル、急ぎの場合は 2.00 ~ 5.00 ドルです。 AI 文字起こしは 1 分あたり 0.004 ~ 0.024 ドルで、40 ~ 750 分の 1 のコストになります。人間による品質レビューに 1 分あたり 0.25 ~ 0.50 ドルが追加されたとしても、AI 支援による文字起こしは完全な手動文字起こしよりも 50 ~ 85 パーセント安いままです。
解いた例
▾
各 60 分のエピソードが 40 個あり、音声は合計 2,400 分になります。 1 分あたり 0.006 ドルで、月額料金は 14.40 ドルです。これは、同じボリュームで月額 2,400 ~ 7,200 ドルかかる人間による文字起こしサービスに代わるものです。コストが 99% 削減されるため、すべてのエピソードの完全な文字起こしが経済的に実行可能になります。
1 分あたり 0.0059 ドルで、話者ダイアライゼーション機能を備えた 5,000 時間 (300,000 分) のリアルタイム通話文字起こし。 Deepgram ストリーミングの料金にはダイアライゼーションが含まれています。これにより、専任の QA アナリストの数分の一のコストで、コンプライアンスと品質保証のためのリアルタイムのエージェント支援と通話後の分析が可能になります。
それぞれ 120 分の 30 件の証言録取は、合計 3,600 分の音声になります。 AI 文字起こしの料金は 23.40 ドルです。人間によるレビューは音声 1 時間あたり 15 分 (総レビュー時間 900 時間)、1 時間あたり 60 ドルで 450 ドル追加されます。合計は 473.40 ドル、完全に人間による法廷記者の文字起こしの場合は 7,200 ~ 14,400 ドルです。
それぞれ 15 分のビデオ 200 件、合計音声 3,000 分。 1 分あたり 0.016 ドルの文字起こしは 48.00 ドル、さらに 1 分あたり 0.002 ドルのキャプション フォーマットは 6.00 ドル追加されます。月額 54 ドルで 200 本のビデオに ADA 準拠のキャプションを追加できるため、あらゆる規模のコンテンツ クリエイターが手頃な価格でアクセシビリティを利用できるようになります。
実際の応用
▾
ポッドキャスト ホスティング プラットフォームは、プレミアム機能として自動文字起こしを提供します。 1 か月あたり 45 分の平均 4 つのエピソードを含む 10,000 のポッドキャストをホストするプラットフォームは、毎月 180 万分の音声を書き起こします。 Whisper API を 1 分あたり 0.006 ドルで使用すると、月額料金は 10,800 ドルになります。ポッドキャスト作成者にはプレミアム機能として月額 5 ドルの料金がかかり、3,000 人の加入者が 15,000 ドルの収益を生み出すこの機能は、アクセシビリティと SEO の利点を提供しながら収益性が高くなります。
医療機関は、医師と患者の面談を医療記録文書として記録します。 500 人の医師が所属する病院ネットワークでは、1 日あたり平均 20 人の患者と面談し、それぞれ 15 分で、1 か月あたり 150,000 分の音声が生成されます。 HIPAA 準拠のサービスを 1 分あたり 0.01 ドルで使用すると、月額 1,500 ドルかかります。医療プログラマーは、1 回の診療につき 5 分間で記録をレビューします。料金は 1 時間あたり 30 ドルで、月額 25,000 ドルが追加されます。合計コスト 26,500 ドルは、手動による医療転写の月額 75,000 ドルに代わるものです。
メディア企業は、アクセシビリティのコンプライアンスと SEO のためにビデオ コンテンツにキャプションを付けます。毎月 5,000 時間の新しいコンテンツを配信するストリーミング プラットフォームでは、Google Cloud Speech を 1 分あたり 0.016 ドルで使用しており、文字起こしには月額 4,800 ドルの費用がかかります。キャプションの自動フォーマットには 600 ドル追加されます。コンテンツ 1 時間あたり 10 分の人間による QA レビューには、8,333 ドルが追加されます。手動キャプション サービスの場合は 50,000 ~ 100,000 ドルであるのに対し、キャプションの総コストは 1 か月あたり 13,733 ドルです。
市場調査会社は、フォーカス グループと顧客インタビューを文字に起こします。毎月 200 件のインタビューを 45 分で実施している企業は、AssemblyAI を使用して話者ダイアライゼーションを 1 分あたり 0.0065 ドルで行い、文字起こしにかかる費用は月額 58.50 ドルです。研究者は、インタビューごとに 10 分間、記録のレビューと注釈付けに費やします。料金は 1 時間あたり 75 ドルで、2,500 ドルが追加されます。月額 2,558.50 ドルのコストにより、以前は月額 8,000 ドルの専任の文字起こしスタッフが必要だった迅速な分析が可能になります。
特殊なケース
▾
HIPAA 準拠の医療転写の場合、すべてのサービスが対象となるわけではありません。
Google Cloud Speech、AWS Transcribe、Azure Speech は、業務提携契約を備えた HIPAA 準拠の構成を提供します。 OpenAI Whisper API と Deepgram は、コンプライアンス認証を伴うエンタープライズ契約を提供します。 HIPAA 準拠のインフラストラクチャ上の自己ホスト型 Whisper は、最大限の制御を提供しますが、専用のセキュリティとコンプライアンスの専門知識が必要です。医療文字起こしには、医療用語に基づいてトレーニングされたカスタム語彙モデルの恩恵も受けられます。
騒音の多い環境(建設現場、レストラン、
騒音の多い環境 (建設現場、レストラン、屋外イベント) で音声を書き写す場合、最高のモデルであっても精度が 60 ~ 75% に低下する可能性があります。 RNNoise や DeepFilterNet などのノイズ低減ツールを使用して前処理を行うと、無視できる計算コストで精度を 10 ~ 20 パーセント向上させることができます。非常にノイズの多いオーディオの場合は、低品質のトランスクリプトを人間が修正するよりも、2 パスのアプローチ (ノイズ低減の後に文字起こし) の方が正確であり、最終的にはコストが安くなります。
歴史的なオーディオ録音(アナログ録音、
過去のオーディオ録音 (アナログ録音、古い電話システム、劣化したテープ) のアーカイブ トランスクリプションの場合、古いモデルの技術的な制限により、オーディオ品質の問題がさらに複雑になります。これらの録音には、低いサンプル レート (8kHz 電話)、顕著な背景ノイズ、および古い語彙が含まれている可能性があります。オーディオをアップサンプリングしてノイズ除去するための特殊な前処理と、特定の音質に合わせて微調整されたモデルを組み合わせることで、1 分あたり 0.002 ドルから 0.01 ドルの追加の前処理コストで、精度を 50 ~ 60 パーセント (標準モデル) から 80 ~ 90 パーセントに向上させることができます。
Speech-to-Text サービスの料金比較 (2025 年)
▾
| サービス | バッチ価格/分 | ストリーミング料金/分 | ダイアライゼーション | 言語 | 無料利用枠 |
|---|---|---|---|---|---|
| OpenAI ウィスパー API | $0.006 | N/A | No | 99+ | No |
| ディープグラム ノヴァ-2 | $0.0043 | $0.0059 | はい ($0.0049) | 36+ | 12,000分 |
| アセンブリAI | $0.0065 | $0.0085 | はい(付属) | 20+ | 100時間 |
| Googleクラウドスピーチ | $0.016 | $0.032 | はい (0.02 ドル) | 125+ | 60分/月 |
| AWS 文字起こし | $0.024 | $0.024 | はい(付属) | 100+ | 60 分/月 (12 か月) |
| アズールスピーチ | $0.016 | $0.016 | はい (0.02 ドル) | 100+ | 5時間/月 |
よくある質問
▾
どの音声テキスト変換サービスが最も正確ですか?
英語の場合、OpenAI Whisper と Deepgram Nova-2 は、クリーンなオーディオで 95 ~ 98 パーセントの単語誤り率という最高の精度を達成します。 Google Cloud Speech と AWS Transcribe は 93 ~ 97% で同等です。特殊なドメイン(医療、法律、金融)の場合、Google Cloud または AWS のカスタム語彙モデルを使用すると、精度が 3 ~ 5 パーセント向上します。ノイズの多い音声、強いアクセント、または多言語コンテンツの場合、精度は 5 ~ 15 パーセント ポイント低下します。
Whisper API は自己ホスト型 Whisper とどう違うのですか?
OpenAI Whisper API は 1 分あたり 0.006 ドルで、管理するインフラストラクチャが不要なマネージド サービスです。クラウド GPU 上のセルフホスト型 Whisper (A10G、1 時間あたり 1.10 ドル) は、リアルタイムの約 10 ~ 30 倍の速度で音声を処理し、フル活用時のコストは 1 分あたり 0.001 ~ 0.002 ドルです。セルフホスティングは 3 ~ 6 倍安価ですが、GPU の管理、スケーリング、監視が必要です。損益分岐点は、1 か月あたり約 5,000 ~ 10,000 オーディオ分です。
バッチ転写とリアルタイム転写の違いは何ですか?
バッチ文字起こしは、事前に録音された音声ファイルを処理し、数分から数時間で結果を返します。リアルタイム (ストリーミング) 文字起こしでは、音声をキャプチャしながら処理し、話されてから 200 ~ 500 ミリ秒以内に単語を返します。バッチは 1.5 ~ 3 倍安く、録画コンテンツに適しています。ライブキャプション、会議の文字起こし、コールセンターのエージェント支援にはリアルタイムが不可欠です。ほとんどのプロバイダーは両方のモードを提供しています。
複数の発言者がいる会議の AI 文字起こしはどの程度正確ですか?
最新のサービスは、2 ~ 4 人の発言者の間で明確な順番をとった会議で 90 ~ 95 パーセントの精度を達成しています。音声が重なっている場合、話者が 6 人を超えている場合、またはマイクの品質が低い場合、精度は 80 ~ 90% に低下します。発言者のダイアライゼーション (誰が何を発言したかの特定) は、十分に離れた発言者に対しては 85 ~ 95% の精度がありますが、混沌とした会議環境では 80% を下回る可能性があります。高品質のマイクと録音セットアップを使用すると、結果が大幅に向上します。
英語以外の言語で転記することはできますか?
はい、主要なサービスはすべて複数の言語をサポートしています。 Whisper は、さまざまな精度で 99 以上の言語をサポートしています。 Google Cloud は 125 以上の言語をサポートしています。英語以外の言語の精度は通常、英語よりも 3 ~ 10 パーセント低くなります。北京語やタイ語などの声調言語の場合、特化したモデルの方が精度が高くなります。 1 分あたりの料金は通常、言語に関係なく同じですが、一部のサービスではあまり一般的でない言語では割増料金がかかります。
避けるべきよくある間違い
▾
- !バッチ ワークロードに対するリアルタイム価格設定の使用:
- !オーディオ品質が精度に与える影響を考慮していない:
- !マルチスピーカーオーディオのスピーカーダイアライゼーションコストを無視する:
プロのヒント
大規模な文字起こしワークロードでコスト効率を最大限に高めるには、自動スケーリングを備えたクラウド GPU 上の Whisper をセルフホストします。 1 時間あたり 1.10 ドルの A10G GPU は、リアルタイムの約 15 倍の速度で音声を書き起こし、1 分あたり約 0.001 ドルの費用がかかります。オーディオ ファイルが送信されると GPU をスピンアップし、キューが空になるとシャットダウンする自動スケール キューを設定します。このアプローチでは、変動するワークロードを効率的に処理しながら、Whisper API と比較して 70 ~ 85% を節約します。
ご存知でしたか?
OpenAI Whisper は、680,000 時間の多言語音声でトレーニングされました。これは、77 年間ノンストップで聞いていることに相当します。 Whisper API は 2022 年にオープンソース モデルとしてリリースされたにもかかわらず、ほとんどの組織にとって API アクセスの利便性がセルフホスティングによるコスト削減を上回るため、依然として最も人気のある文字起こしサービスの 1 つです。
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
Get Weekly Math Tips
Join 12,000+ subscribers who get calculator tips every week.