Що таке Speech-to-Text API Cost Calculator?
▾
Калькулятор вартості перетворення мовлення в текст оцінює витрати на транскрибування аудіо в текст за допомогою AI-сервісів, зокрема OpenAI Whisper API (0,006 дол. США за хвилину), Google Cloud Speech-to-Text (0,016 дол. США за хвилину для стандартних моделей), AWS Transcribe (0,024 дол. США за хвилину), Deepgram (0,0043 дол. США за хвилину для Nova-2) і AssemblyAI ($0,0065 за хвилину). Ці служби перетворюють розмовну мову в письмовий текст із точністю від 90 до 98 відсотків залежно від якості звуку, мови та вибраної моделі. Цей калькулятор обслуговує компанії, які займаються виробництвом подкастів, команди аналітики колл-центрів, юридичні служби транскрипції, медіакомпанії, що створюють субтитри до відеовмісту, а також інструменти продуктивності зустрічей, які генерують автоматичні стенограми. 60-хвилинний епізод подкасту коштує 0,36 долара за транскрипцію за допомогою Whisper API, 0,96 долара за допомогою Google Speech або 0,26 долара за допомогою Deepgram. У масштабі ці відмінності значно посилюються: кол-центр, який транскрибує 10 000 годин дзвінків на місяць, заплатить 3600 доларів за Whisper, 9600 доларів за Google або 2580 доларів за Deepgram. Крім основної вартості транскрипції, калькулятор також враховує функції, які впливають на ціноутворення: щоденник мовця (визначення того, хто що сказав), обробка в режимі реального часу проти пакетної обробки (зазвичай у режимі реального часу коштує у 2–3 рази дорожче), спеціальні моделі словника та витрати на постобробку для форматування, вставки пунктуації та сегментації абзаців. Розуміння повної вартості допомагає командам вибрати правильну послугу відповідно до їхніх вимог до точності та бюджетних обмежень.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Формула
▾
Вартість транскрипції = тривалість аудіо в хвилинах x ціна за хвилину. Для пакетної обробки 500 годин аудіо на місяць на Whisper API: Вартість = 500 x 60 x 0,006 $ = 180,00 $ на місяць. Для транскрипції в Google Cloud у реальному часі за удвічі більшою ціною: Вартість = 500 x 60 x 0,032 $ = 960,00 $.Опис змінних
▾
| Символ | Ім'я | Одиниця | Опис |
|---|---|---|---|
| D | Тривалість аудіо | minutes | Загальний аудіовміст для транскрибування, виміряний у хвилинах, із типовим мовленням, що містить від 130 до 160 слів на хвилину. |
| P | Ціна за хвилину | USD per minute | Вартість послуги транскрипції за хвилину аудіо в діапазоні від 0,0043 $ для Deepgram до 0,024 $ для AWS Transcribe. |
| R_stream | Потоковий множник | ratio (1.5 to 3.0) | Коефіцієнт вартості потокової транскрипції в реальному часі порівняно з пакетною обробкою, що застосовується, коли потрібні результати з низькою затримкою. |
| T_review | Час перегляду на годину аудіо | minutes | Людина потребує часу для перегляду та виправлення на годину транскрибованого аудіо, зазвичай від 10 до 30 хвилин залежно від вимог до точності. |
| H | Погодинна ставка рецензента | USD per hour | Вартість редакторів, які переглядають і виправляють транскрипції штучним інтелектом, коливається від 25 до 75 доларів США на годину залежно від досвіду в області. |
Як Speech-to-Text API Cost Calculator
▾
- 1Визначте загальну тривалість аудіо для транскрибування на місяць. Вимірюйте в хвилинах або годинах і розрізняйте попередньо записане (пакетне) і живе (у реальному часі) аудіо. Пакетна транскрипція, як правило, дешевша і може підтримувати більший час обробки. Транскрипція в реальному часі дає результати у вигляді аудіопотоків, але коштує в 1,5-3 рази дорожче через інтенсивність обчислень обробки з низькою затримкою.
- 2Виберіть послугу транскрипції на основі вимог до точності, підтримки мови та бюджету. Whisper API пропонує найкраще співвідношення ціни та якості для більшості мов за 0,006 доларів США за хвилину. Deepgram Nova-2 є найдешевшим варіантом за $0,0043 за хвилину з конкурентоспроможною точністю. Google Cloud і AWS пропонують найширшу підтримку мов та інтеграцію з відповідними хмарними екосистемами. AssemblyAI надає найкращі функції щоденника та аналізу вмісту.
- 3Налаштуйте функції транскрипції, які впливають на ціноутворення. Діаризація доповідача (визначення різних доповідачів) додає від 10 до 30 відсотків базових витрат на транскрипцію на більшості платформ. Пунктуація та великі літери включені за замовчуванням у сучасних сервісах. Потокове передавання в реальному часі коштує в 2-3 рази дорожче пакетної обробки. Користувацький словник або галузеві моделі можуть мати додаткові витрати на деяких платформах.
- 4Обчисліть базову вартість транскрипції, помноживши загальну кількість аудіохвилин на ставку за хвилину. Для змішаних робочих навантажень у реальному часі та пакетних навантажень обчислюйте кожне окремо: пакетне аудіо зі стандартною швидкістю та аудіо в реальному часі з підвищеною швидкістю. Сумуйте ці два для загальних місячних витрат на транскрипцію.
- 5Додайте витрати на постобробку, якщо це можливо. Необроблені вихідні дані транскрипції часто потребують форматування: розриви абзаців, мітки доповідачів, вставка позначки часу, видалення слів-заповнювачів і виправлення, пов’язані з доменом. Автоматизована постобробка за допомогою LLM (GPT-4o-mini) коштує приблизно від 0,001 до 0,005 доларів США за хвилину обробки аудіо. Постобробка вручну редактором коштує від 0,50 до 2,00 доларів США за аудіохвилину залежно від необхідної точності.
- 6Враховуйте витрати на зберігання аудіофайлів і стенограм. Аудіофайли зі швидкістю 128 Кбіт/с споживають приблизно 1 МБ за хвилину. Текст стенограми незначний за розміром. Хмарне сховище за ціною 0,02 долара США за ГБ на місяць означає, що зберігання 10 000 годин аудіо (600 ГБ) коштує 12 доларів США на місяць. Якщо вам потрібно зберегти аудіо для відповідності, включіть ці поточні витрати на зберігання.
- 7Порівняйте загальну вартість із послугами транскрипції людиною. Професійна транскрипція людиною коштує від $1,00 до $3,00 за аудіохвилину для стандартного виконання та від $2,00 до $5,00 для термінової доставки. ШІ-транскрипція за $0,004 до $0,024 за хвилину в 40-750 разів дешевша. Навіть якщо перевірка якості людиною додає від 0,25 до 0,50 доларів США за хвилину, транскрипція за допомогою штучного інтелекту залишається на 50–85 відсотків дешевшою, ніж повністю ручна транскрипція.
Розв'язані приклади
▾
40 епізодів по 60 хвилин кожна загалом 2400 аудіохвилин. При 0,006 долара за хвилину місячна вартість становить 14,40 долара. Це замінює послугу транскрипції людиною, яка стягуватиме від 2400 до 7200 доларів на місяць за той самий обсяг. Зниження вартості на 99 відсотків робить повну транскрипцію економічно вигідною для кожного епізоду.
5000 годин (300 000 хвилин) транскрипції розмов у реальному часі з діарізацією мовця за 0,0059 доларів США за хвилину. Ціни на потокову передачу Deepgram включають діаризацію. Це забезпечує допомогу агента в режимі реального часу та аналітику після виклику для відповідності та гарантії якості за невелику частку вартості виділених аналітиків із забезпечення якості.
30 показань по 120 хвилин кожне загалом 3600 аудіохвилин. Транскрипція AI коштує 23,40 доларів. Перегляд людиною за 15 хвилин на аудіогодину (900 годин загального часу перегляду) за 60 доларів США за годину додає 450 доларів США. Загальна сума становить 473,40 доларів США проти 7 200–14 400 доларів США за транскрипцію судових репортерів.
200 відеороликів по 15 хвилин кожне разом становить 3000 аудіохвилин. Транскрипція за $0,016 за хвилину коштує $48,00, плюс форматування субтитрів за $0,002 за хвилину додає $6,00. Субтитри для 200 відео за 54 долари США на місяць, що відповідають вимогам ADA, роблять доступність доступною для творців вмісту будь-якого розміру.
Практичне застосування
▾
Платформи хостингу подкастів пропонують автоматичну транскрипцію як преміум-функцію. Платформа, яка містить 10 000 подкастів із середньою кількістю 4 епізодів на місяць по 45 хвилин, транскрибує 1,8 мільйона аудіохвилин щомісяця. Використовуючи Whisper API за 0,006 доларів США за хвилину, щомісячна вартість становить 10 800 доларів США. Плата за плату в розмірі 5 доларів США на місяць для творців подкастів як преміум-функція, з 3000 передплатниками, які генерують дохід у розмірі 15 000 доларів США, функція є прибутковою, але забезпечує доступність і переваги для SEO.
Організації охорони здоров’я записують зустрічі лікаря з пацієнтом для документації медичних записів. Лікарняна мережа з 500 лікарями, які в середньому відвідують 20 пацієнтів на день по 15 хвилин кожен, генерує 150 000 аудіохвилин на місяць. Використання служби, сумісної з HIPAA, за 0,01 долара за хвилину коштує 1500 доларів на місяць. Медичні кодери переглядають стенограми за 5 хвилин за кожну зустріч із ціною 30 доларів США на годину, додаючи 25 000 доларів США щомісяця. Загальна вартість 26 500 доларів США замінює 75 000 доларів США на місяць у ручній медичній транскрипції.
Медіакомпанії створюють субтитри до відеоконтенту для відповідності стандартам доступності та оптимізації пошукових систем. Потокова платформа з 5000 годинами нового вмісту на місяць використовує Google Cloud Speech за 0,016 доларів США за хвилину, що коштує 4800 доларів США на місяць за транскрипцію. Автоматичне форматування підписів додає 600 доларів США. Людський аналіз якості за 10 хвилин за годину контенту додає 8333 долари. Загальна вартість субтитрів становить 13 733 доларів США на місяць порівняно з 50 000–100 000 доларів США за послуги ручного створення субтитрів.
Фірми, які займаються дослідженнями ринку, транскрибують фокус-групи та опитування клієнтів. Фірма, яка проводить 200 інтерв’ю на місяць по 45 хвилин кожне, використовує AssemblyAI з діарізацією доповідача за 0,0065 доларів США за хвилину, що коштує 58,50 доларів США на місяць за транскрипцію. Дослідники витрачають 10 хвилин на інтерв’ю, переглядаючи та анотуючи стенограми за ціною 75 доларів США на годину, що додає 2500 доларів США. Щомісячна вартість 2558,50 доларів США дає змогу проводити швидкий аналіз, який раніше вимагав спеціального персоналу транскрипції за 8000 доларів США на місяць.
Особливі випадки
▾
Для медичної транскрипції, сумісної з HIPAA, не всі послуги підходять.
Google Cloud Speech, AWS Transcribe і Azure Speech пропонують конфігурації, сумісні з HIPAA, з угодами ділового партнерства. OpenAI Whisper API і Deepgram пропонують корпоративні угоди з сертифікатами відповідності. Власний Whisper на інфраструктурі, сумісній з HIPAA, забезпечує найбільший контроль, але потребує спеціальних знань із безпеки та відповідності. Медична транскрипція також виграє від спеціальних моделей словника, навчених на медичній термінології.
Для транскрибування аудіо в шумному середовищі (будівельні майданчики, ресторани,
Для транскрибування аудіо в шумному середовищі (будівельні майданчики, ресторани, заходи на відкритому повітрі) точність може впасти до 60–75 відсотків навіть у найкращих моделях. Попередня обробка за допомогою інструментів зменшення шуму, таких як RNNoise або DeepFilterNet, може підвищити точність на 10–20 процентних пунктів за незначних обчислювальних витрат. Для надзвичайно шумного аудіо двопрохідний підхід (зменшення шуму з подальшим транскрибуванням) є більш точним і, зрештою, дешевшим, ніж покладатися на людське виправлення низькоякісних стенограм.
Для архівної транскрипції історичних аудіозаписів (аналогових записів,
Для архівної транскрипції історичних аудіозаписів (аналогових записів, старих телефонних систем, пошкодженої стрічки) проблеми з якістю звуку поєднуються з технологічними обмеженнями старіших моделей. Ці записи можуть мати низьку частоту дискретизації (телефон 8 кГц), значний фоновий шум і застарілу лексику. Спеціальна попередня обробка для підвищення дискретизації та зменшення шуму аудіо в поєднанні з точно налаштованими моделями для конкретної якості аудіо може підвищити точність від 50–60 відсотків (стандартні моделі) до 80–90 відсотків за додаткової вартості попередньої обробки від 0,002 до 0,01 долара за хвилину.
Порівняння цін на послугу Speech-to-Text (2025)
▾
| Сервіс | Ціна партії/мін | Ціна потокового передавання/мін | Діаризація | Мови | Вільний рівень |
|---|---|---|---|---|---|
| OpenAI Whisper API | 0,006 доларів США | N/A | No | 99+ | No |
| Deepgram Nova-2 | 0,0043 доларів США | 0,0059 доларів США | Так ($0,0049) | 36+ | 12 000 хв |
| ЗбіркаAI | 0,0065 доларів США | 0,0085 доларів США | Так (в комплекті) | 20+ | 100 годин |
| Google Cloud Speech | 0,016 доларів США | 0,032 доларів США | Так ($0,02) | 125+ | 60 хв/міс |
| AWS Transcribe | 0,024 доларів США | 0,024 доларів США | Так (в комплекті) | 100+ | 60 хв/міс (12 міс) |
| Лазурне мовлення | 0,016 доларів США | 0,016 доларів США | Так ($0,02) | 100+ | 5 годин/міс |
Часті запитання
▾
Яка служба перетворення мовлення в текст є найточнішою?
Для англійської мови OpenAI Whisper і Deepgram Nova-2 досягають найвищої точності від 95 до 98 відсотків помилок у словах для чистого звуку. Google Cloud Speech і AWS Transcribe можна порівняти на 93–97 відсотків. Для спеціалізованих областей (медичної, юридичної, фінансової) спеціальні моделі словника в Google Cloud або AWS можуть підвищити точність на 3–5 процентних пунктів. Точність падає на 5–15 процентних пунктів для шумного звуку, сильних акцентів або багатомовного вмісту.
Як Whisper API порівнюється з Whisper, розміщеним на власному хості?
OpenAI Whisper API за 0,006 дол. США за хвилину – це керована служба без інфраструктури для керування. Самостійний Whisper на хмарному графічному процесорі (A10G за 1,10 дол. США за годину) обробляє аудіо зі швидкістю приблизно в 10–30 разів у реальному часі, коштуючи 0,001–0,002 дол. США за хвилину при повному використанні. Самостійне розміщення в 3-6 разів дешевше, але вимагає керування GPU, масштабування та моніторинг. Беззбитковість становить приблизно від 5 000 до 10 000 аудіохвилин на місяць.
Яка різниця між пакетною транскрипцією та транскрипцією в реальному часі?
Пакетна транскрипція обробляє попередньо записані аудіофайли та повертає результати за хвилини до годин. Транскрипція в режимі реального часу (потокова) обробляє аудіо під час його запису та повертає слова протягом 200–500 мс після проголошення. Пакет в 1,5-3 рази дешевший і підходить для записаного контенту. Режим реального часу важливий для субтитрів у реальному часі, транскрипції нарад і допомоги агента колл-центру. Більшість провайдерів пропонують обидва режими.
Наскільки точним є транскрибування штучним інтелектом для зустрічей із кількома спікерами?
Сучасні сервіси забезпечують точність від 90 до 95 відсотків для зустрічей із чіткою чергою від 2 до 4 доповідачів. Точність знижується до 80–90 відсотків у разі накладання мови, використання більше ніж 6 динаміків або низької якості мікрофона. Діаризація доповідача (визначення того, хто що сказав) є точною від 85 до 95 відсотків для добре розділених доповідачів, але може опускатися нижче 80 відсотків у хаотичному середовищі зустрічі. Використання високоякісних мікрофонів і налаштувань запису значно покращує результати.
Чи можу я транскрибувати іншими мовами, крім англійської?
Так, усі основні служби підтримують кілька мов. Whisper підтримує понад 99 мов із різною точністю. Google Cloud підтримує понад 125 мов. Точність для неанглійських мов зазвичай на 3–10 процентних пунктів нижча, ніж для англійської. Для тональних мов, таких як мандарин і тайська, спеціалізовані моделі пропонують кращу точність. Ціна за хвилину зазвичай однакова незалежно від мови, хоча деякі служби стягують надбавку за менш поширені мови.
Поширені помилки
▾
- !Використання ціноутворення в реальному часі для пакетних робочих навантажень:
- !Без урахування впливу якості звуку на точність:
- !Ігнорування витрат на діаризацію динаміка для аудіо з кількома динаміками:
Порада профі
Щоб отримати максимальну економічну ефективність під час великих навантажень транскрипції, самостійно розмістіть Whisper на хмарному графічному процесорі з автоматичним масштабуванням. Графічний процесор A10G за ціною 1,10 доларів США на годину транскрибує аудіо зі швидкістю, яка приблизно в 15 разів перевищує швидкість реального часу, коштуючи приблизно 0,001 доларів США за хвилину. Налаштуйте чергу з автоматичним масштабуванням, яка запускає графічні процесори, коли надсилаються аудіофайли, і вимикає їх, коли черга порожня. Цей підхід економить від 70 до 85 відсотків порівняно з Whisper API, одночасно ефективно обробляючи змінні навантаження.
Чи знаєте ви?
OpenAI Whisper навчався на 680 000 годинах багатомовного аудіо, що еквівалентно безперервному прослуховуванню протягом 77 років. Незважаючи на те, що Whisper API був випущений як модель з відкритим вихідним кодом у 2022 році, він залишається однією з найпопулярніших служб транскрипції, оскільки зручність доступу до API переважує економію витрат на самостійне розміщення для більшості організацій.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
Отримуйте щотижневі поради з математики
Приєднуйтеся до 12 000+ підписників, які щотижня отримують поради щодо калькулятора.