OpenAI Whisper — мировой стандарт локального распознавания речи с открытым исходным кодом. В 2026 году модель Whisper Large-v3 расшифровывает часовое аудио на русском языке за 1.5–2 минуты на обычном GPU, автоматически расставляет знаки препинания, тайм-коды и генерирует готовые субтитры .vtt и .srt.
Ниже представлена практическая инструкция по установке, ускоренному запуску через Faster-Whisper и настройке разделения спикеров (диаризации).
Сравнение моделей Whisper и системные требования
Для разных задач и конфигураций ПК выбирается соответствующий размер модели:
| Модель | Параметры | Требуемая VRAM (Faster-Whisper) | Скорость (RTX 4070) | Качество русского языка |
|---|---|---|---|---|
| Tiny / Base | 39M – 74M | 1.0 GB | 80x realtime | Среднее (подходит для черновых заметок) |
| Small / Medium | 244M – 769M | 2.0 – 2.8 GB | 60x realtime | Высокое (отличный баланс скорости) |
| Large-v3 | 1550M | 4.2 GB (FP16) / 3.0 GB (INT8) | 45x realtime | Максимальное (профессиональная расшифровка) |
| Large-v3-Turbo | 809M | 3.2 GB | 65x realtime | 98% точности Large-v3 при скорости Medium |
Шаг 1. Быстрый запуск Whisper через консоль (CLI)
Самый простой способ транскрибировать файл — использовать официальный Python-пакет или CLI-утилиту.

Установка зависимостей:
Для обработки медиафайлов потребуется установленный ffmpeg и Python:
# macOS (через Homebrew)
brew install ffmpeg
# Ubuntu / Debian
sudo apt install ffmpeg
# Установка Whisper и PyTorch с поддержкой CUDA
pip install -U openai-whisper
Команда запуска транскрибации:
whisper meeting_2026.mp3 --model large-v3 --language ru --device cuda --output_format all
После завершения в папке появятся файлы .txt, .vtt, .srt и .json с полной разметкой.
Шаг 2. Ускорение в 4 раза с Faster-Whisper и веб-интерфейсом
Оригинальный Whisper на PyTorch работает медленнее, чем оптимизированная реализация Faster-Whisper на движке CTranslate2.

Пример скрипта на Python с Faster-Whisper:
from faster_whisper import WhisperModel
# Загрузка модели в квантованном виде INT8 для экономии памяти
model = WhisperModel("large-v3", device="cuda", compute_type="int8_float16")
segments, info = model.transcribe("meeting.mp3", language="ru", beam_size=5)
print(f"Обнаружен язык: {info.language} (вероятность: {info.language_probability:.2f})")
print(f"Длительность аудио: {info.duration / 60:.1f} мин\n")
with open("transcript.txt", "w", encoding="utf-8") as f:
for segment in segments:
line = f"[{segment.start:.2f}s -> {segment.end:.2f}s] {segment.text}\n"
print(line, end="")
f.write(line)
Шаг 3. Диаризация: разделение реплик по спикерам (WhisperX)
Чтобы в итоговом тексте было видно, кто именно говорит («Спикер 1: … Спикер 2: …»), используется связка с нейросетью PyAnnote через WhisperX:

Команда для транскрибации с определением спикеров:
pip install whisperx
whisperx interview.wav --model large-v3 --language ru --diarize --hf_token HF_ACCESS_TOKEN
Фреймворк выполнит фонемное выравнивание (Phoneme Alignment) и точно сопоставит голосовые отпечатки с репликами в субтитрах.
Шаг 4. Сравнение производительности: GPU против CPU
Транскрибация длинных аудиофайлов требует значительных вычислительных мощностей.

- NVIDIA GPU (CUDA): Обработка 60 минут записи занимает ~1.2–1.5 минуты (скорость 45x realtime).
- Apple Silicon (M3/M4 Metal): Обработка 60 минут занимает ~2.5–3 минуты (скорость 22x realtime).
- Обычный процессор (CPU 16 ядер): Обработка 60 минут занимает ~18–20 минут (скорость 3.2x realtime).
Резюме и следующие шаги
Локальный запуск Whisper дает полную независимость от платных облачных сервисов и гарантирует безопасность конфиденциальных записей.
Следующим логичным шагом является автоматическое создание саммари и конспектов полученного текста или его перевод и озвучка на другие языки.