СлушАЙ Открыть сервис
страница · wav в текст

WAV в текст

WAV пишут там, где качество звука имеет значение: студийные рекордеры, петлички, интервью «в поле». Это лучший исходник для распознавания — и единственный формат, где реально можно упереться в лимит по размеру.

несжатый звук — лучший исходник до 2 ГБ на файл петлички и рекордеры
фрагмент · interview_A_ch1.wav · 38:14 · 44,1 кГц стерео
08:31ИнтервьюерДавайте вернёмся к первому году. Что оказалось самым неожиданным?
08:39РеспондентЧто продукт был не при чём. Мы полгода чинили то, что никто не считал сломанным.
09:02ИнтервьюерА как поняли, что чините не то?

Когда WAV — правильный выбор

Интервью на рекордер

Zoom H-серия, Tascam и подобные пишут в wav по умолчанию. Это ровно тот случай, когда несжатый звук оправдан.

Петличные микрофоны

Запись с петлички — самый чистый исходник: голос близко, фон далеко, точность максимальная.

Мультидорожечная запись

Свели дорожки в один wav — присылайте его. Разделение по спикерам сработает и здесь.

Архивные записи

Оцифрованные кассеты и старые архивы чаще всего лежат именно в wav.

Считаем размер: где пройдёт граница

WAV не сжимается, поэтому размер растёт линейно со временем. Здесь лимит в 2 ГБ действительно достижим — в отличие от mp3:

44,1 кГц стерео
≈ 10 МБ в минуту · 2 ГБ ≈ 3 ч 20 мин — почти упирается в лимит времени
44,1 кГц моно
≈ 5 МБ в минуту · 4 часа ≈ 1,2 ГБ — проходит спокойно
48 кГц стерео
≈ 11 МБ в минуту · 2 ГБ ≈ 3 часа — граница по размеру наступит раньше
Если не влезает
сохраните дорожку в моно или экспортируйте в mp3 128 кбит/с — на распознавание это не повлияет

Стерео, моно и качество текста

  • Стерео не даёт прироста точности. Речь распознаётся по содержанию, а не по панораме: моно-дорожка даст тот же текст вдвое легче.
  • 96 кГц и 24 бита — избыточны. Для распознавания хватает 16 кГц; всё сверху занимает место, но не улучшает результат.
  • А вот чистота записи — критична. Именно ради неё wav и имеет смысл: близкий микрофон и тихая комната дают заметно более точный текст.
  • Клиппинг не лечится. Если голос ушёл в перегруз при записи, ни один распознаватель его не восстановит.
30 минут — бесплатно Дальше пакеты от 370 ₽, минута — от 0,83 ₽. Купленные минуты не сгорают. списание — только после успешной расшифровки
Открыть @slush_ai_bot

Частые вопросы

Файл wav больше 2 ГБ — что делать?
Сохраните дорожку в моно или экспортируйте в mp3 128 кбит/с: размер упадёт в разы, а на качество распознавания это не повлияет. Либо разбейте запись на две части.
WAV распознаётся точнее, чем mp3?
Практически нет. Разница между несжатым звуком и mp3 от 64 кбит/с для распознавания речи почти незаметна — гораздо важнее, насколько близко стоял микрофон.
Загрузка большого wav в Telegram долгая. Есть альтернатива?
Да: залейте файл в Яндекс.Диск, Google Drive или Dropbox, откройте доступ по ссылке и пришлите ссылку — бот заберёт файл сам.
Можно прислать дорожку прямо из монтажной программы?
Да, экспорт из Audacity, Reaper, Audition или Premiere подойдёт. Достаточно свести всё в один файл.