是什么 Speech-to-Text API Cost Calculator?
▾
语音转文本成本计算器估算使用 AI 服务将音频转录为文本的费用,包括 OpenAI Whisper API(每分钟 0.006 美元)、Google Cloud Speech-to-Text(标准模型每分钟 0.016 美元)、AWS Transcribe(每分钟 0.024 美元)、Deepgram(Nova-2 每分钟 0.0043 美元)和 AssemblyAI(每分钟 0.0065 美元)。这些服务将口语转换为书面文本,准确率达到 90% 到 98%,具体取决于音频质量、语言和模型选择。 该计算器为播客制作公司、呼叫中心分析团队、法律转录服务、为视频内容添加字幕的媒体公司以及生成自动转录文本的会议生产力工具提供服务。使用 Whisper API 转录一集 60 分钟的播客费用为 0.36 美元,使用 Google Speech 转录为 0.96 美元,使用 Deepgram 转录为 0.26 美元。从规模上看,这些差异会显着加剧:每月转录 10,000 小时通话的呼叫中心将向 Whisper 支付 3,600 美元,向 Google 支付 9,600 美元,或者向 Deepgram 支付 2,580 美元。 除了基本的转录成本之外,计算器还考虑了影响定价的功能:说话者分类(识别谁说了什么)、实时处理与批处理(实时成本通常高出 2 到 3 倍)、专门的词汇模型以及格式化、标点符号插入和段落分段的后处理成本。了解完整的成本堆栈有助于团队根据其准确性要求和预算限制选择正确的服务。
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
公式
▾
转录成本 = 音频持续时间(分钟)x 每分钟价格。对于在 Whisper API 上每月批量处理 500 小时的音频:成本 = 500 x 60 x 0.006 美元 = 每月 180.00 美元。对于 Google Cloud 上以 2 倍速率进行的实时转录:成本 = 500 x 60 x 0.032 美元 = 960.00 美元。变量说明
▾
| 符号 | 名称 | 单位 | 描述 |
|---|---|---|---|
| D | 音频持续时间 | minutes | 要转录的总音频内容(以分钟为单位),典型语音每分钟包含 130 到 160 个单词。 |
| P | 每分钟价格 | USD per minute | 每分钟音频的转录服务费率,范围从 Deepgram 的 0.0043 美元到 AWS Transcribe 的 0.024 美元。 |
| R_stream | 流媒体乘数 | ratio (1.5 to 3.0) | 实时流转录与批处理的成本乘数,在需要低延迟结果时应用。 |
| T_review | 每个音频小时的审阅时间 | minutes | 每小时转录音频所需的人工审核和校正时间通常为 10 到 30 分钟,具体取决于准确性要求。 |
| H | 审稿人每小时费率 | USD per hour | 审查和纠正 AI 转录的人类编辑的成本从每小时 25 美元到 75 美元不等,具体取决于领域专业知识。 |
如何 Speech-to-Text API Cost Calculator
▾
- 1确定每月转录的总音频持续时间。以分钟或小时为单位进行测量,并区分预先录制的(批量)和现场(实时)音频。批量转录通常更便宜并且可以接受更长的处理时间。实时转录以音频流的形式提供结果,但由于低延迟处理的计算强度,成本要高出 1.5 到 3 倍。
- 2根据准确性要求、语言支持和预算选择转录服务。 Whisper API 为大多数语言提供最佳性价比,每分钟 0.006 美元。 Deepgram Nova-2 是最便宜的选择,每分钟 0.0043 美元,具有竞争性的准确性。 Google Cloud 和 AWS 提供最广泛的语言支持以及与其各自云生态系统的集成。 AssemblyAI 提供了最好的演讲者分类和内容分析功能。
- 3配置影响定价的转录功能。在大多数平台上,说话人分类(识别不同的说话人)会增加 10% 到 30% 的基本转录成本。现代服务默认包含标点符号和大写字母。实时流处理的成本是批处理的 2 到 3 倍。自定义词汇或行业特定模型在某些平台上可能会产生额外费用。
- 4通过将总音频分钟数乘以每分钟费率来计算基本转录成本。对于混合实时和批处理工作负载,分别计算:标准速率的批处理音频和高速率的实时音频。将两者相加即为每月转录费用总额。
- 5如果适用,请添加后处理成本。原始转录输出通常需要格式化:段落分隔符、说话者标签、时间戳插入、填充词删除和特定领域的更正。使用 LLM (GPT-4o-mini) 的自动后处理每分钟处理音频的成本约为 0.001 至 0.005 美元。由人工编辑进行手动后期处理的成本为每分钟 0.50 美元到 2.00 美元,具体取决于所需的准确性。
- 6考虑音频文件和文字记录的存储成本。 128 kbps 的音频文件每分钟大约消耗 1 MB。文字记录的大小可以忽略不计。云存储的价格为每月每 GB 0.02 美元,这意味着存储 10,000 小时的音频 (600 GB) 的成本为每月 12 美元。如果您需要保留音频以确保合规性,请包含此持续存储成本。
- 7将总成本与人工转录服务进行比较。标准周转的专业人工转录费用为每音频分钟 1.00 至 3.00 美元,紧急交付费用为 2.00 至 5.00 美元。 AI 转录每分钟 0.004 至 0.024 美元,便宜 40 至 750 倍。即使人工质量审核每分钟增加 0.25 至 0.50 美元,人工智能辅助转录仍比完全手动转录便宜 50% 至 85%。
例题解析
▾
40 集,每集 60 分钟,总共 2,400 分钟音频。按每分钟 0.006 美元计算,每月费用为 14.40 美元。这取代了人工转录服务,相同数量的人工转录服务每月收费 2,400 至 7,200 美元。成本降低了 99%,使得每集的完整转录在经济上可行。
5,000 小时(300,000 分钟)的实时通话转录,说话人分类为每分钟 0.0059 美元。 Deepgram 流式定价包括二值化。这使得实时代理协助和呼叫后分析能够实现合规性和质量保证,而成本只是专门 QA 分析师的一小部分。
30 次证词,每次 120 分钟,总共 3,600 分钟音频。 AI 转录费用为 23.40 美元。每个音频小时 15 分钟的人工审核(总审核时间 900 小时)为 60 美元/小时,增加 450 美元。总计为 473.40 美元,而完全由人类法庭记者转录的费用为 7,200 至 14,400 美元。
200 个视频,每个视频 15 分钟,总共 3,000 分钟音频。每分钟 0.016 美元的转录费用为 48.00 美元,加上每分钟 0.002 美元的字幕格式则增加 6.00 美元。 200 个视频的 ADA 合规字幕价格为每月 54 美元,使各种规模的内容创作者都能负担得起。
实际应用
▾
播客托管平台提供自动转录作为一项高级功能。一个托管 10,000 个播客的平台,平均每月播放 4 集,每集 45 分钟,每月转录 180 万分钟音频。使用 Whisper API 每分钟 0.006 美元,每月费用为 10,800 美元。作为一项高级功能,该功能每月向播客创作者收取 5 美元的费用,拥有 3,000 名订阅者,创造了 15,000 美元的收入,该功能在提供可访问性和 SEO 优势的同时也是有利可图的。
医疗保健组织将医患接触记录为医疗记录文档。拥有 500 名医生的医院网络平均每天会诊 20 名患者,每次 15 分钟,每月会产生 150,000 分钟的音频。使用符合 HIPAA 标准的服务(每分钟 0.01 美元)的费用为每月 1,500 美元。医疗编码员每次检查记录只需 5 分钟,每小时 30 美元,每月增加 25,000 美元。总成本为 26,500 美元,相当于每月 75,000 美元的手动医疗转录成本。
媒体公司为视频内容添加字幕以确保可访问性合规性和搜索引擎优化 (SEO)。每月提供 5,000 小时新内容的流媒体平台使用 Google Cloud Speech,每分钟 0.016 美元,每月转录费用为 4,800 美元。自动字幕格式会增加 600 美元。每个内容小时 10 分钟的人工 QA 审核会增加 8,333 美元。每月字幕总成本为 13,733 美元,而手动字幕服务的费用为 50,000 至 100,000 美元。
市场研究公司记录焦点小组和客户访谈。一家公司每月进行 200 次采访,每次采访 45 分钟,使用 AssemblyAI 进行演讲者分类,每分钟 0.0065 美元,每月转录成本为 58.50 美元。研究人员每次采访花费 10 分钟审查和注释笔录,每小时 75 美元,增加了 2,500 美元。每月 2,558.50 美元的成本可实现快速分析,而以前需要每月 8,000 美元的专门转录人员。
特殊情况
▾
对于符合 HIPAA 的医疗转录,并非所有服务都符合资格。
Google Cloud Speech、AWS Transcribe 和 Azure Speech 通过业务伙伴协议提供符合 HIPAA 的配置。 OpenAI Whisper API 和 Deepgram 提供具有合规性认证的企业协议。在符合 HIPAA 的基础设施上自托管 Whisper 可提供最大程度的控制,但需要专门的安全和合规专业知识。医学转录还受益于接受医学术语训练的自定义词汇模型。
用于在嘈杂环境(建筑工地、餐馆、
对于在嘈杂环境(建筑工地、餐馆、户外活动)中转录音频,即使使用最好的模型,准确度也会下降至 60% 至 75%。使用 RNNoise 或 DeepFilterNet 等降噪工具进行预处理可以将准确性提高 10 到 20 个百分点,而计算成本可以忽略不计。对于极其嘈杂的音频,两遍方法(降噪后转录)比依赖人工校正低质量转录本更准确且最终更便宜。
用于历史录音的存档转录(模拟录音、
对于历史录音(模拟录音、旧电话系统、劣化磁带)的存档转录,音频质量问题与旧型号的技术限制相结合。这些录音可能具有低采样率(8kHz 电话)、显着的背景噪音和过时的词汇。对音频进行上采样和降噪的专门预处理,结合针对特定音频质量的微调模型,可以将准确度从 50% 至 60%(标准模型)提高到 80% 至 90%,每分钟额外的预处理成本为 0.002 至 0.01 美元。
语音转文本服务定价比较 (2025)
▾
| 服务 | 批量价格/分钟 | 流媒体价格/分钟 | 分类 | 语言 | 免费套餐 |
|---|---|---|---|---|---|
| OpenAI Whisper API | 0.006 美元 | N/A | No | 99+ | No |
| Deepgram Nova-2 | $0.0043 | 0.0059 美元 | 是(0.0049 美元) | 36+ | 12,000分钟 |
| 装配人工智能 | $0.0065 | 0.0085 美元 | 是(包含在内) | 20+ | 100小时 |
| 谷歌云语音 | $0.016 | 0.032 美元 | 是(0.02 美元) | 125+ | 60 分钟/月 |
| AWS 转录 | 0.024 美元 | 0.024 美元 | 是(包含在内) | 100+ | 60 分钟/月(12 个月) |
| 蔚蓝言语 | $0.016 | $0.016 | 是(0.02 美元) | 100+ | 5 小时/月 |
常见问题
▾
哪种语音转文本服务最准确?
对于英语,OpenAI Whisper 和 Deepgram Nova-2 在干净的音频上实现了最高准确率,单词错误率为 95% 至 98%。 Google Cloud Speech 和 AWS Transcribe 的相似度为 93% 至 97%。对于专业领域(医疗、法律、金融),Google Cloud 或 AWS 上的自定义词汇模型可以将准确性提高 3 到 5 个百分点。对于嘈杂的音频、重口音或多语言内容,准确度会下降 5 到 15 个百分点。
Whisper API 与自托管 Whisper 相比如何?
OpenAI Whisper API 是一项托管服务,无需管理基础设施,每分钟 0.006 美元。云 GPU 上的自托管 Whisper(A10G,1.10 美元/小时)以大约 10 到 30 倍实时速度处理音频,充分利用时每分钟成本为 0.001 到 0.002 美元。自托管的成本要便宜 3 到 6 倍,但需要 GPU 管理、扩展和监控。盈亏平衡点约为每月 5,000 至 10,000 分钟的音频时间。
批量转录和实时转录有什么区别?
批量转录处理预先录制的音频文件并在几分钟到几小时内返回结果。实时(流式)转录会在捕获音频时对其进行处理,并在说出后 200 到 500 毫秒内返回单词。 Batch 便宜 1.5 到 3 倍,适合录制内容。实时对于实时字幕、会议转录和呼叫中心代理协助至关重要。大多数提供商都提供这两种模式。
对于多位发言者的会议,人工智能转录的准确度如何?
现代服务可实现 90% 至 95% 的会议准确率,并在 2 至 4 名发言者之间进行清晰的轮流发言。如果语音重叠、发言者超过 6 个或麦克风质量较差,准确度会下降至 80% 至 90%。对于间隔良好的发言者,发言者分类(识别谁说了什么)的准确度为 85% 到 95%,但在混乱的会议环境中可能会低于 80%。使用高质量麦克风和录音设置可以显着改善结果。
我可以用英语以外的语言进行转录吗?
是的,所有主要服务都支持多种语言。 Whisper 支持 99 多种语言,但准确性各异。 Google Cloud 支持超过 125 种语言。非英语语言的准确率通常比英语低 3 到 10 个百分点。对于普通话和泰语等声调语言,专门的模型可以提供更好的准确性。无论使用哪种语言,每分钟的费用通常都是相同的,尽管某些服务对不太常见的语言收取额外费用。
常见错误注意事项
▾
- !对批量工作负载使用实时定价:
- !不考虑音频质量对准确性的影响:
- !忽略多扬声器音频的扬声器分类成本:
专业提示
为了最大程度地提高大型转录工作负载的成本效率,请在具有自动扩展功能的云 GPU 上自行托管 Whisper。每小时 1.10 美元的 A10G GPU 以大约 15 倍实时速度转录音频,每分钟成本约为 0.001 美元。设置一个自动缩放队列,在提交音频文件时启动 GPU,并在队列为空时关闭 GPU。与 Whisper API 相比,这种方法可节省 70% 到 85%,同时还能有效处理可变工作负载。
你知道吗?
OpenAI Whisper 接受了 680,000 小时的多语言音频训练,相当于连续聆听 77 年。尽管 Whisper API 于 2022 年作为开源模型发布,但它仍然是最受欢迎的转录服务之一,因为对于大多数组织而言,API 访问的便利性超过了自托管所节省的成本。
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
获取每周数学提示
加入 12,000+ 订阅者,每周都会获得计算器提示。