Whisper — открытая нейросеть распознавания речи от OpenAI. Она бесплатна, понимает русский (и ещё почти сотню языков) и работает целиком на вашем компьютере: интервью, лекцию или созвон можно расшифровать, не загружая запись ни в какой онлайн-сервис. Ниже — какие есть способы её запустить и какой выбрать.
Цена этого — своё железо: расшифровка идёт со скоростью вашего компьютера, а не серверной фермы. На обычном ноутбуке час записи маленькой моделью расшифровывается быстрее часа, большой — может считаться дольше самой записи.
Технически это python-пакет. Классический вариант — openai-whisper,
быстрый — faster-whisper (та же модель, в несколько раз быстрее
на процессоре):
pip install faster-whisper.ffmpeg.base до large-v3) скачается при первом запуске.Для Whisper есть приложения с обычным окном: перетащил файл — получил текст. Известные — Buzz (Windows, Mac, Linux; бесплатный, открытый код) и MacWhisper (только Mac; базовая версия бесплатна, полная — разовая покупка в долларах). Под капотом тот же Whisper, так что качество то же, что и в консоли.
Наша «Наговори» уже работает на этом движке — faster-whisper распознаёт живую диктовку у тысяч фраз в день. Сейчас мы учим её второй задаче: перетащили запись — получили текст с тайм-кодами и субтитры, по-русски, без консоли и без облака, с разовой оплатой рублями. Подробности и анонс — на странице транскрибации.
| Модель | Скорость | Качество русского | Кому подходит |
|---|---|---|---|
| base | быстрая даже на слабом ноутбуке | терпимое: смысл ясен, огрехи в словах | черновик, поиск по записи |
| small | средняя | хорошее для большинства задач | рабочая лошадка: созвоны, лекции |
| medium | небыстрая на процессоре | заметно точнее на терминах и фамилиях | интервью под публикацию |
| large-v3 | медленная без видеокарты | максимум | сложный звук, акценты, шум |
Практическое правило: начните со small — для чистой русской речи её обычно достаточно, а время расшифровки остаётся разумным. Плохой микрофон и спорные места лечатся шагом вверх, а не перезаписью.
Мы собираем транскрибацию файлов и ссылок в «Наговори»: перетащили запись — получили текст и субтитры, всё на вашем компьютере, оплата рублями один раз. А диктовка на том же движке уже работает — 3 дня использования бесплатно.
Правда: OpenAI выложила модель в открытый доступ, лицензия позволяет пользоваться свободно. «Подвох» один — запускать её надо самому на своём железе: платят здесь не деньгами, а временем на установку и расшифровку.
Русский — один из сильных языков Whisper: на чистой речи модели small и выше дают текст, который правится за минуты, с расставленной по смыслу пунктуацией. Качество падает на шумных записях и перебивающих друг друга голосах — это общая беда распознавания, не только Whisper.
Да: faster-whisper оптимизирован под обычные процессоры. Модели base и small работают на любом современном ноутбуке; medium и large без видеокарты будут считать заметно дольше записи — тут поможет либо GPU, либо терпение.
Да, Whisper выдаёт текст с тайм-кодами, из которых собираются файлы SRT/VTT — консольные инструменты и обёртки типа Buzz умеют экспортировать их сразу. Наша транскрибация тоже будет отдавать субтитры.
Двумя вещами: запись не уходит на чужой сервер и нет платы за минуты. Онлайн-сервисы выигрывают в скорости на длинных записях и в фишках вроде саммари. Если записи чувствительные — выбор в пользу локального очевиден.
Не средствами самого Whisper: нужна отдельная диаризация. В бесплатных обёртках её обычно нет либо она сложна в установке. Если «кто говорит» критично — смотрите специализированные сервисы для встреч.
Остались вопросы? На странице помощи — разбор частых проблем, а внизу справа — кнопка «Помощь»: спросите своими словами, помощник ответит сразу.