infoclaw.ru
  • Подборки
  • ИИ-агенты
  • Код с ИИ ▾
    • Вайб-кодинг
    • Claude Code
    • MCP-серверы
    • Для разработчиков
    • Сравнения
  • OpenClaw ▾
    • Что такое OpenClaw
    • Установка
    • Навыки
    • Ошибки и решения
    • Интеграции
    • Безопасность
    • Сценарии использования
    • Enterprise
    • Hermes Agent
  • Свой ИИ ▾
    • Локальный ИИ
    • Доступ из России
    • Цены и подписки
  • Обучение ▾
    • Обучение нейросетям
    • ИИ в профессии
    • Как сделать
  • Материалы ▾
    • Новости
    • Разборы
    • Глоссарий
FAQ
  1. Главная
  2. Как сделать
  3. Как транскрибировать аудио и видео с помощью Whisper: локально и бесплатно
Как сделать

Как транскрибировать аудио и видео с помощью Whisper: локально и бесплатно

Полное руководство по расшифровке аудио и видеозаписей через OpenAI Whisper и Faster-Whisper. Локальный запуск на GPU и CPU, тайм-коды, разделение спикеров и экспорт в VTT/SRT.

Степан Ноянов · 24 августа 2026 г. · 3 мин чтения
Как транскрибировать аудио и видео с помощью Whisper: локально и бесплатно

В этом материале

  1. Сравнение моделей Whisper и системные требования
  2. Шаг 1. Быстрый запуск Whisper через консоль (CLI)
  3. Шаг 2. Ускорение в 4 раза с Faster-Whisper и веб-интерфейсом
  4. Шаг 3. Диаризация: разделение реплик по спикерам (WhisperX)
  5. Шаг 4. Сравнение производительности: GPU против CPU
  6. Резюме и следующие шаги

OpenAI Whisper — мировой стандарт локального распознавания речи с открытым исходным кодом. В 2026 году модель Whisper Large-v3 расшифровывает часовое аудио на русском языке за 1.5–2 минуты на обычном GPU, автоматически расставляет знаки препинания, тайм-коды и генерирует готовые субтитры .vtt и .srt.

Ниже представлена практическая инструкция по установке, ускоренному запуску через Faster-Whisper и настройке разделения спикеров (диаризации).


Сравнение моделей Whisper и системные требования

Для разных задач и конфигураций ПК выбирается соответствующий размер модели:

МодельПараметрыТребуемая VRAM (Faster-Whisper)Скорость (RTX 4070)Качество русского языка
Tiny / Base39M – 74M1.0 GB80x realtimeСреднее (подходит для черновых заметок)
Small / Medium244M – 769M2.0 – 2.8 GB60x realtimeВысокое (отличный баланс скорости)
Large-v31550M4.2 GB (FP16) / 3.0 GB (INT8)45x realtimeМаксимальное (профессиональная расшифровка)
Large-v3-Turbo809M3.2 GB65x realtime98% точности Large-v3 при скорости Medium

Шаг 1. Быстрый запуск Whisper через консоль (CLI)

Самый простой способ транскрибировать файл — использовать официальный Python-пакет или CLI-утилиту.

Консоль терминала с процессом распознавания часовой аудиозаписи через Whisper large-v3
Консоль терминала с процессом распознавания часовой аудиозаписи через Whisper large-v3снято Август 2026

Установка зависимостей:

Для обработки медиафайлов потребуется установленный ffmpeg и Python:

# macOS (через Homebrew)
brew install ffmpeg

# Ubuntu / Debian
sudo apt install ffmpeg

# Установка Whisper и PyTorch с поддержкой CUDA
pip install -U openai-whisper

Команда запуска транскрибации:

whisper meeting_2026.mp3 --model large-v3 --language ru --device cuda --output_format all

После завершения в папке появятся файлы .txt, .vtt, .srt и .json с полной разметкой.


Шаг 2. Ускорение в 4 раза с Faster-Whisper и веб-интерфейсом

Оригинальный Whisper на PyTorch работает медленнее, чем оптимизированная реализация Faster-Whisper на движке CTranslate2.

Интерфейс Faster-Whisper WebUI с разбивкой по тайм-кодам и диаризацией спикеров
Интерфейс Faster-Whisper WebUI с разбивкой по тайм-кодам и диаризацией спикеровснято Август 2026

Пример скрипта на Python с Faster-Whisper:

from faster_whisper import WhisperModel

# Загрузка модели в квантованном виде INT8 для экономии памяти
model = WhisperModel("large-v3", device="cuda", compute_type="int8_float16")

segments, info = model.transcribe("meeting.mp3", language="ru", beam_size=5)

print(f"Обнаружен язык: {info.language} (вероятность: {info.language_probability:.2f})")
print(f"Длительность аудио: {info.duration / 60:.1f} мин\n")

with open("transcript.txt", "w", encoding="utf-8") as f:
    for segment in segments:
        line = f"[{segment.start:.2f}s -> {segment.end:.2f}s] {segment.text}\n"
        print(line, end="")
        f.write(line)

Шаг 3. Диаризация: разделение реплик по спикерам (WhisperX)

Чтобы в итоговом тексте было видно, кто именно говорит («Спикер 1: … Спикер 2: …»), используется связка с нейросетью PyAnnote через WhisperX:

Готовый файл транскрибации с точными тайм-кодами и именами спикеров
Готовый файл транскрибации с точными тайм-кодами и именами спикеровснято Август 2026

Команда для транскрибации с определением спикеров:

pip install whisperx

whisperx interview.wav --model large-v3 --language ru --diarize --hf_token HF_ACCESS_TOKEN

Фреймворк выполнит фонемное выравнивание (Phoneme Alignment) и точно сопоставит голосовые отпечатки с репликами в субтитрах.


Шаг 4. Сравнение производительности: GPU против CPU

Транскрибация длинных аудиофайлов требует значительных вычислительных мощностей.

График ускорения транскрибации на GPU NVIDIA RTX против обычного процессора
График ускорения транскрибации на GPU NVIDIA RTX против обычного процессораснято Август 2026
  • NVIDIA GPU (CUDA): Обработка 60 минут записи занимает ~1.2–1.5 минуты (скорость 45x realtime).
  • Apple Silicon (M3/M4 Metal): Обработка 60 минут занимает ~2.5–3 минуты (скорость 22x realtime).
  • Обычный процессор (CPU 16 ядер): Обработка 60 минут занимает ~18–20 минут (скорость 3.2x realtime).

Резюме и следующие шаги

Локальный запуск Whisper дает полную независимость от платных облачных сервисов и гарантирует безопасность конфиденциальных записей.

Следующим логичным шагом является автоматическое создание саммари и конспектов полученного текста или его перевод и озвучка на другие языки.

ИИ-аватары

Сделаем цифрового двойника эксперта

Видео-аватар с клонированным голосом: контент, уроки и продажи от вашего лица без съёмок. Более 100 языков, ролики собираются из текста.

  • Видео и клон голоса
  • Контент без съёмочной группы
  • Опыт: цифровые двойники экспертов
🛡️ Официальный договор и NDA 💼 Данные в вашем контуре ⚡ Пилот 5–7 дней

Бесплатная консультация и смета

Расскажите задачу — предложу архитектуру и оценю сроки. Отвечает Степан Ноянов.

Или напишите сразу напрямую в Telegram: @noystem ↗

Теги: Whisperтранскрибацияраспознавание речилокальный ИИPythonсубтитрыаудиоGPU

Вам также может быть интересно

Как сделать

Как перевести и озвучить видео с помощью ИИ в 2026 году: дубляж, голос и Lip-sync

24 августа 2026 г. 7 мин
Как сделать

Как сделать качественное саммари книги, статьи или видео с помощью ИИ в 2026 году

24 августа 2026 г. 7 мин
Как сделать

Как написать скрипт на Python нейросетью: парсеры, боты и автоматизация рутины

24 августа 2026 г. 6 мин
💰
Инструмент Калькулятор стоимости AI-моделей Сравните цены GPT-5.4, Claude и Gemini за минуту
→
🎯
Квиз · 2 мин Какой OpenClaw подходит вам? 5 вопросов — персональная рекомендация
→

Популярное

  1. ИИ-агент для 1С: что можно подключить и с чего начать ИИ-агенты
  2. Как пользоваться Claude Code: первый день + 6 ошибок Claude Code
  3. Вайбкодинг с чего начать: инструкция + 6 ошибок новичка Вайб-кодинг
  4. Вайб-кодинг в 1С: 6 инструментов + где цикл разомкнут Вайб-кодинг
  5. Ошибки OpenClaw: 7 групп + что проверять в каждой Ошибки и решения

Категории

  • Что такое OpenClaw (8)
  • Установка (16)
  • Навыки (23)
  • Интеграции (15)
  • Сравнения (17)
  • Сценарии использования (23)
  • Новости (120)
  • Enterprise / NemoClaw (15)
  • Безопасность (10)
  • Для разработчиков (5)
  • Ошибки и решения (71)
  • Доступ из России (6)
  • Локальный ИИ (9)
  • ИИ-агенты (24)
  • Разборы (79)
  • Hermes Agent (10)
  • MCP-серверы (37)
  • Нейросети: цены и доступ (21)
  • Как сделать (42)
  • Обучение (4)
  • Глоссарий (12)
  • Claude Code (11)
  • Вайб-кодинг (11)
  • ИИ в профессии (4)

Недавнее

  • ИИ для протокола совещаний: 16 сервисов транскрибации встреч + бесплатный путь сегодня
  • ИИ-обзвон и голосовые роботы для бизнеса: 14 сервисов + 4 ошибки сегодня
  • Нейросеть для карточек товара: 14 сервисов + бесплатно сегодня

Быстрый старт

Новичок в OpenClaw? Начните отсюда:

  • → Что такое OpenClaw
  • → Установка за 10 минут
  • → Топ-10 навыков
  • → Подключить Telegram

Теги

установканавыкиtelegramwhatsappmacoswindowsenterpriseголосopen-sourcellmprivacynode.js
infoclaw.ru

Независимый информационный ресурс об ИИ-агенте OpenClaw. Статьи, гайды и новости на русском языке.

Разделы

  • Вайб-кодинг
  • Claude Code
  • MCP-серверы
  • Что такое OpenClaw
  • Установка
  • Навыки
  • Интеграции
  • Сравнения
  • Enterprise
  • ИИ в профессии
  • Цены и подписки
  • Новости

Интеграции

  • Telegram
  • WhatsApp
  • Slack
  • Discord
  • iMessage
  • Teams
  • Matrix
  • Все (20+) →

Ресурсы

  • Вопросы и ответы
  • Глоссарий
  • Для разработчиков
  • Разборы
  • Карта сайта

© 2026 infoclaw.ru — Независимый ресурс. Не является официальным сайтом проекта OpenClaw.

О проекте Автор Политика конфиденциальности Пользовательское соглашение Контакты