🎙 CrisperWhisper 2.0 ● распознавание речи дословно, с точностью до слова ● EN ● by Nyra Labs
Ссылка на GitHub: nyrahealth/CrisperWhisper
Автор: Nyra Labs (nyra health)
Дата обновления: 27 июля 2026
Версия: 2.0.1 (PyPI)
Категории: #ASR #речьвтекст #субтитры #Whisper
Платформа: Windows / Linux / macOS, ставится через pip
Язык интерфейса: EN (Python API)
Совместимость: NVIDIA CUDA через CTranslate2, либо PyTorch — включая голый CPU
Системные требования: четыре размера — turbo / small / medium / large, квантование float16 и int8_float16
🖥 Описание софта
Все системы распознавания речи молча решают за вас один вопрос: записывать то, что человек сказал, или то, что он имел в виду. Решают неосознанно — как получилось в обучающих данных, и каждый раз по-разному. CrisperWhisper 2.0 впервые делает этот выбор явным переключателем. Одна запись — две расшифровки: дословная, со всеми «э-э», запинками, оборванными словами и смехом, — и чистая, где числа, даты и почта уже приведены к человеческому виду. Плюс лучшие в индустрии пословные тайминги: 29,6 мс средней ошибки границы слова против 64,8 мс у WhisperX.
😬 Что умеет CrisperWhisper 2.0
🟠 Два режима одной командой: verbatim — каждый филлер, повтор, заикание и фальстарт; intended — чистый читаемый текст
🟠 Пословные тайминги 29,6 мс на читаной речи и 41 мс на разговорной — первое место, обгоняет Grok, ElevenLabs Scribe v2, Deepgram и WhisperX
🟠 Детекция запинок 87,8 F1 в среднем по десяти языкам. Для сравнения: ElevenLabs Scribe v2 — 79,2, Deepgram Nova-3 — 37,8, AssemblyAI Universal-3 Pro — 30,5, прошлая версия CrisperWhisper — 64,8
🟠 Verbatimize — уникальная штука: даёте аудио и уже готовую чистую расшифровку, модель вставляет в неё ровно те запинки, что реально звучат. Узнаваемость редких слов взлетает с 6,8% до 96,1% против повторной расшифровки с нуля
🟠 Длинное аудио без швов: каждое окно продолжает уже расшифрованные слова, поэтому на стыках не пропадают и не задваиваются куски
🟠 Подавление галлюцинаций встроено в декодер и включено по умолчанию — та самая беда Whisper, когда он зацикливается и сочиняет текст на тишине
🟠 Спекулятивное декодирование: маленькая модель предлагает токены, большая проверяет — тот же результат в 1,3–1,4 раза быстрее
🟠 Оба режима за один проход, принудительное выравнивание готового текста по аудио, буст на нужные имена и термины
🟠 Мультиязычность на уровне обычного Whisper — оба режима работают на большинстве поддерживаемых им языков
💿 Установка и запуск
⁍ NVIDIA + Linux, самый быстрый путь:
pip install "crisperwhisper[ct2]"
⁍ Windows, macOS или просто CPU:
pip install "crisperwhisper[transformers]"
from crisperwhisper import CrisperWhisperModel
model = CrisperWhisperModel()
result = model.transcribe("meeting.wav", language="en", word_timestamps=True)
⁍ Веса скачиваются с HuggingFace при первом запуске
⭐️ Поставить звезду на GitHub - звёзд уже больше тысячи
🌐 Онлайн демо - для тестирования в браузере
🤗 Модели на HuggingFace - четыре открытые и одна Pro по заявкам
💬 Обсудить в нашем чате
👾 РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ