CrisperWhisper 2.0 Turbo

High-accuracy verbatim & intended speech recognition with word-level timestamps. The model captures every filler, stutter, and false start (verbatim mode) or produces a clean, readable transcript (intended mode).

Model Card | GitHub

Transcription Mode
Verbatim: exact words including fillers/stutters. Intended: clean, readable text.
Language
ISO 639-1 language code
Examples