Диктуй

asr ∙ whisper

Распознавание речи 2026: чем заменяют Whisper и что с русским

28 июля OpenAI выпустила GPT Transcribe вместо Whisper. Разбираю независимый замер точности, цену часа аудио и что известно про русскую речь.

15 минут чтенияавтор Михаил Воинский, основатель Диктуй
Коротко

28 июля 2026 OpenAI выпустила gpt-transcribe и gpt-live-transcribe и в документации советует начинать с них, а не с Whisper. Заявленное падение ошибок вдвое посчитано против устаревшего whisper-1 — это Whisper Large-v2 конца 2022 года, а не turbo-вариант, на котором работают десктопные инструменты. На независимом индексе AA-WER у gpt-transcribe 3,3% ошибок против 4,1% у whisper-1 и 4,6% у Whisper Large-v3-turbo, а три чужие модели точнее и дешевле неё. Отдельных замеров на русском для новых моделей никто не опубликовал.

Модели распознавания речи за лето 2026 перетасовались сильнее, чем за предыдущие два года, и заметнее всего это видно по одной фразе в документации OpenAI. Раздел про транскрибацию файлов теперь открывается указанием: начинать с gpt-transcribe, а специализированную модель брать, только если нужны метки говорящих, тайм-коды по словам, формат субтитров или перевод на английский. Специализированная модель в этом списке — whisper-1, тот самый Whisper, вокруг которого за четыре года собралась половина индустрии голосового ввода. Из рекомендованного по умолчанию он превратился в запасной вариант для трёх узких задач.

Читайте дальше как мнение заинтересованной стороны: Whisper — модель, на которой работает мой продукт, поэтому статья про то, как её подвинули, для меня не отвлечённая новость, а рабочее решение с ценником. Из-за этого я сознательно держусь опубликованных цифр и независимого лидерборда, а собственную кухню показываю в одном разделе ближе к концу — там, где она к делу.

Три понятия, без которых дальше не разобраться. Распознавание речи — превращение звучащей речи в письменный текст; в англоязычных материалах и названиях моделей эта задача обозначается сокращением ASR (automatic speech recognition, автоматическое распознавание речи). Все современные системы этого класса — нейросети, обученные на десятках и сотнях тысяч часов записей; правил и словарей, как в программах девяностых, внутри у них нет. Качество меряют долей ошибок в словах (word error rate, WER): сколько слов из ста модель заменила, пропустила или добавила. Три процента ошибок — это три неверных слова на сотню, и все цифры ниже именно в этой шкале.

Что именно выпустила OpenAI 28 июля?

28 июля 2026 в API появились две модели распознавания речи. gpt-transcribe работает с готовыми записями и пакетными задачами, gpt-live-transcribe — с потоком из микрофона, звонка или трансляции по WebSocket и WebRTC.

Раздел «File transcription» в документации OpenAI на 7 августа 2026: начинать предлагается с gpt-transcribe, а специализированная модель нужна только ради меток говорящих, тайм-кодов по словам, формата субтитров или перевода на английский.

Главное содержательное новшество — не проценты, а способ передать модели контекст. У Whisper для этого было одно поле prompt длиной до 224 токенов. У gpt-transcribe их три, и документация разводит их по назначению:

  • prompt — свободное описание записи: о чём разговор, кто говорит, какая обстановка;
  • keywords — список точных терминов, которые ожидаются в звуке: артикулы, номера договоров, имена;
  • languages — список кодов языков вместо прежнего одиночного language, то есть модели прямо говорят, что в записи будет переключение между языками.

Последний пункт стоит отдельного внимания для русскоязычного читателя. Речь разработчика или маркетолога — это русский с английскими вкраплениями вроде deploy, endpoint, retention, и раньше приходилось выбирать одну раскладку на весь файл. Теперь ожидаемый набор языков заявляется списком. Документация при этом предупреждает о жёсткостях: language и languages вместе слать нельзя, а перенос строки или угловая скобка внутри ключевого слова обрушивает весь запрос.

Цены: 0,0045 доллара за минуту у файловой модели и 0,017 доллара за минуту у потоковой. Это 0,27 и примерно 1 доллар за час аудио, то есть около 22 и 83 рублей по курсу ЦБ 81,41 на 7 августа 2026.

Почему «ошибок вдвое меньше» — это не про тот Whisper, что стоит у вас

Заголовок, который разошёлся по новостям: ошибки упали более чем вдвое. Замеров у OpenAI на самом деле два, и оба в её пользу. На наборе Common Voice по 22 языкам — 19,27 процента ошибок против 40,37 у whisper-1. На наборе Real-World Audio Recording по девяти языкам — 8,98 против 15,21, то есть минус 41 процент. Обе цифры компания опубликовала в ленте для разработчиков, и придраться к самим измерениям нечем.

Придраться можно к точке отсчёта. В обоих случаях это whisper-1 — устаревший endpoint OpenAI на основе Whisper Large-v2 конца 2022 года. Модель, на которой реально работают десктопные инструменты голосового ввода, другая: Whisper Large-v3-turbo, вышедшая в октябре 2024 с декодером, укороченным с 32 слоёв до четырёх. Между whisper-1 и turbo-вариантом два поколения и почти два года. Архитектурный разбор самой модели я делал отдельно.

Насколько это меняет картину, видно, когда обе модели меряет кто-то третий и на одних и тех же записях.

Какая модель распознавания речи самая точная в 2026 году

Лидерборд Artificial Analysis считает единый индекс AA-WER: долю ошибок в словах, взвешенную по длительности, на трёх наборах записей — разговоры с ассистентом, парламентские речи и звонки инвесторам. Записи ближе к жизни, чем студийный Common Voice, а моделей в индексе около полусотни.

Доля ошибок в словах по индексу AA-WER лидерборда Artificial Analysis на 7 августа 2026: Scribe v2 — 2,2 процента, MAI-Transcribe-1.5 — 2,4, Voxtral Small — 2,8, Universal-3 Pro — 3,1, GPT Transcribe — 3,3, whisper-1 — 4,1, Whisper Large-v3-turbo на Groq — 4,6.

Картина получается другая. gpt-transcribe даёт 3,3 процента ошибок, whisper-1 — 4,1. Разрыв 0,8 пункта, а не двукратный. Вдвое ошибки падают на собственных наборах OpenAI; на общем для всех аудио прирост есть, но скромный.

И верхушку рейтинга новая модель OpenAI не занимает. Точнее неё в индексе ровно одиннадцать строк: Fun-Realtime-ASR-preview от Alibaba с 1,7 процента, Scribe v2 от ElevenLabs с 2,2, MAI-Transcribe-1.5 от Microsoft и Smallest AI Pulse Pro с 2,4, MAI-Transcribe-1 с 2,6, Voxtral Small от Mistral и Gemini 3.1 Pro Preview от Google с 2,8, Gemini 3 Flash и Gemini 2.5 Pro с 2,9, Universal-3 Pro от AssemblyAI с 3,1 и Solaria-3 от Gladia с 3,2. За лето 2026 сложилась плотная группа моделей точнее того, что предлагает OpenAI, — просто без громких заголовков.

Одна оговорка про этот индекс, которую стоит держать в голове весь оставшийся текст: все три набора записей англоязычные. Русского в нём нет.

Дополнение от 27 августа 2026. В индексе пока нет и двух свежих моделей: Canto от Wispr, показанной 17 августа, и S1-Voice от Superwhisper, вышедшей 19 августа. Обе заявлены самими компаниями, стороннего замера не проходили, и их числа посчитаны по своим методикам — почему их нельзя ставить в один ряд с этой таблицей, разобрано в статье про августовский передел рынка голосового ввода.

Сколько стоит час аудио и где ломается выгода?

Точность без цены ничего не решает, поэтому те же модели полезно посмотреть в двух координатах сразу.

Точность против цены часа аудио на 7 августа 2026: Universal-3 Pro, Scribe v2 и Voxtral Small одновременно точнее и дешевле GPT Transcribe, а turbo-вариант Whisper уступает 1,3 пункта точности при цене почти в семь раз ниже.
МодельОшибок в словахЦена за часТайм-кодыОткрытые веса
Scribe v2 · ElevenLabs2,2%$0,22данет
MAI-Transcribe-1.5 · Microsoft2,4%$0,36данет
Voxtral Small · Mistral2,8%$0,24дада
Universal-3 Pro · AssemblyAI3,1%$0,21данет
GPT Transcribe · OpenAI3,3%$0,27нетнет
whisper-1 · OpenAI4,1%$0,36дада (веса Whisper Large-v2)
Whisper Large-v3-turbo · Groq4,6%$0,04дада

В таблице семь моделей из примерно полусотни оценённых — те, что нужны для сравнения с новинкой; полный список точнее неё идёт ниже. Из таблицы вылезает главное неудобное для новинки наблюдение: Universal-3 Pro, Scribe v2 и Voxtral Small обходят gpt-transcribe сразу по обеим осям — они и точнее, и дешевле, и при этом сохранили тайм-коды. Рекомендация в документации OpenAI, разумеется, про её собственную линейку, а не про рынок целиком, и путать одно с другим не стоит.

Со стороны дешёвого края всё держит Whisper Large-v3-turbo на инфраструктуре Groq: 0,04 доллара за час против 0,27 у gpt-transcribe, разница почти семикратная при 1,3 пункта в точности — примерно одно ошибочное слово на сотню.

Дальше арифметика объёма. На десяти часах аудио в месяц разница между этими вариантами — 2,3 доллара, меньше двухсот рублей, и о ней незачем думать. На пятистах часах счёт выходит 135 долларов против 20, и вопрос «стоит ли одно слово из сотни лишних 115 долларов в месяц» становится содержательным. Дороже всех при этом выходит именно whisper-1: 0,36 доллара за час при 4,1 процента ошибок — худшее сочетание в таблице. Тем, кто до сих пор сидит на нём, переезжать действительно пора, только необязательно на gpt-transcribe.

Потоковый режим — отдельная история. gpt-live-transcribe даёт 19,70 процента ошибок на том же Common Voice против 20,33 у прежней потоковой модели gpt-realtime-whisper. Прирост 0,63 пункта при неизменной цене 0,017 доллара за минуту. Прорыв случился в пакетной обработке, а не в живой. Разбор прежнего потокового стека OpenAI с ценами и сценариями — в отдельной статье.

Чего gpt-transcribe не умеет по сравнению с whisper-1?

Список короткий, но для части задач блокирующий.

Нет тайм-кодов. Параметр timestamp_granularities поддерживается только у whisper-1. Значит, из ответа новой модели нельзя собрать субтитры SRT и VTT: не к чему привязывать реплики. Для тех, кто делает субтитры к видео, это отменяет переезд целиком — пошаговый разбор такого сценария построен как раз вокруг файла с тайм-кодами.

Нет перевода. Endpoint переводов работает только с whisper-1 и только на английский.

Нет разделения говорящих. Для меток спикеров у OpenAI отдельная модель gpt-4o-transcribe-diarize с форматом ответа diarized_json; ей можно подсунуть до четырёх образцов голоса длиной 2–10 секунд, чтобы сопоставить сегменты с известными людьми. В потоковых сессиях разделение говорящих не поддерживается вообще.

Файл до 25 мегабайт. Часовая запись в приличном качестве в этот лимит не помещается, и её надо либо сжимать, либо резать на куски. Документация отдельно предупреждает не резать посреди предложения: обрубленный контекст роняет точность.

Что известно про распознавание русской речи?

Прямой ответ: цифр нет ни у кого, включая меня.

OpenAI опубликовала две общие средние — по 22 языкам Common Voice и по девяти языкам Real-World Audio — без разбивки по языкам. Индекс AA-WER считается на английских записях. Российские публикации про релиз, включая новость на Хабре, пересказывают те же общие цифры. Своего замера на русском я тоже пока не делал, поэтому фразу «новая модель точнее Whisper по-русски» произносить не буду: под ней нет ничего, кроме экстраполяции.

Что про русский известно точно, так это две вещи. Первая — на русской речи без помех и специальной лексики Whisper-семейство держит около 5–6 процентов ошибок в turbo-варианте, а заточенная под русский GigaAM v3 от Сбера — 3,3 процента; расклад по нескольким моделям с методологией замера сведён в разборе точности голосового ввода.

Вторая — в июне 2026 Сбер выложил GigaAM Multilingual: кодировщики на 220 и 600 миллионов параметров, предобучение на двух миллионах часов, 70 с лишним языков, лицензия MIT. Разработчики заявляют лучшее качество среди открытых моделей по ошибкам на русском, казахском, киргизском и узбекском. Готового настольного клиента у неё нет, разворачивать надо самому, но для серверной обработки русского это самый интересный релиз лета — и он прошёл почти без внимания, в отличие от американских.

Похоже, русский сейчас находится в положении, когда общие рейтинги про него ничего не говорят, а заточенные под него модели остаются уделом тех, кто готов собирать пайплайн руками.

Локальное распознавание речи: что можно запустить у себя

Отдельная развилка, которая после этого релиза стала заметнее. Ни gpt-transcribe, ни Scribe v2, ни MAI-Transcribe локально не запускаются: веса закрыты, доступ только по API. Как только требование «звук не покидает компьютер» становится жёстким — из-за врачебной тайны, адвокатской тайны или внутренней политики компании, — весь верх рейтинга отпадает целиком, и выбирать приходится среди открытых моделей.

Вариантов четыре, и они закрывают разные задачи.

Whisper Large-v3-turbo под лицензией MIT — универсальный выбор: 99 языков в обучении, устойчивое поведение на смеси русского с английскими терминами. Важная поправка к цифрам выше: 4,6 процента ошибок в таблице — это развёртывание на Groq, где поверх модели навешены отсечение тишины фильтром Silero и нормализация пунктуации языковой моделью. Голая модель у себя работает хуже: на русском разница между локальным запуском и Groq в моих замерах составила 8,1 процента против 5,6. По скорости на MacBook Air M2 минута записи расшифровывается за 7–9 секунд, на ноутбуке с Intel без видеокарты — за полминуты и больше; замеры на конкретном железе есть в разборе открытых настольных решений.

faster-whisper — не отдельная модель, а другой движок для тех же весов: реализация на CTranslate2. По бенчмарку репозитория на видеокарте RTX 3070 Ti тринадцатиминутный файл проходит за 1 минуту 3 секунды против 2 минут 23 секунд у обычной реализации, а в режиме INT8 — за 59 секунд при 2,9 гигабайта видеопамяти вместо 4,7. Замер снят на весах Large-v2, но выигрыш движка переносится и на turbo. Вариант для тех, кто поднимает собственный сервер, а не диктует за ноутбуком.

GigaAM от Сбера, тоже MIT, — единственный из четырёх, заточенный под русский: 3,3 процента ошибок в версии v3. Обновление апреля 2026 добавило тайм-коды по словам и поддержку Triton Inference Server. Цена вопроса — отсутствие готового приложения: всё собирается руками.

Voxtral Small от Mistral под лицензией Apache 2.0 — формально самая точная из открытых, 2,8 процента в индексе, но с оговоркой про железо: 24 миллиарда параметров требуют порядка 55 гигабайт видеопамяти, то есть это серверный вариант, а не «поставил на ноутбук». Для устройств у Mistral есть отдельная младшая версия на 3 миллиарда параметров.

Готовые настольные программы, которые крутят локальный Whisper без единой строчки кода, разобраны в обзоре открытых решений для голосового ввода.

Раз уж речь зашла о врачебной и адвокатской тайне, скажу прямо про свой продукт: Диктуй облачный, звук уходит на распознавание, и для материалов, которые по закону не должны покидать компьютер, он не подходит — тут нужны именно локальные варианты из этого раздела.

Как подключиться к новым моделям из России

Прямая оплата OpenAI российской картой не проходит, ни МИР, ни СБП. Рабочая схема прежняя: рублёвые агрегаторы доступа к API — ProxyAPI, GenAPI, AITunnel, Vsegpt, Polza AI. Они проксируют запросы через свою инфраструктуру, принимают рубли через ЮKassa и СБП и выдают фискальный чек ОФД, что закрывает вопрос учёта для ИП и ООО. Наценка к тарифу OpenAI обычно 10–25 процентов.

Один нюанс, на котором легко потерять день: свежие модели доезжают до каталогов агрегаторов с задержкой в дни или недели. Перед пополнением баланса стоит открыть каталог и убедиться, что там появились именно gpt-transcribe и gpt-live-transcribe, а не только прежние gpt-4o-transcribe и whisper-1. В коде при этом меняется только адрес endpoint и ключ — вызовы openai-python и openai-node остаются как были.

Меняю ли я модель под своим продуктом?

Тот раздел, где я перестаю быть наблюдателем. Диктуй — настольная программа голосового ввода и транскрибации для Windows и macOS, работает на Whisper Large-v3-turbo, и вопрос «переезжать ли на gpt-transcribe» я решал не как редактор, а как человек, который платит за инференс.

Разложил на четыре пункта.

Цена. Семикратный рост стоимости часа при разнице 1,3 пункта в точности. На нашем объёме это ощутимая статья расходов ради прибавки, которую пользователь на короткой диктовке не заметит.

Лимит файла. Транскрибация в продукте принимает записи до двух часов; в 25 мегабайт такое не влезает, и пришлось бы городить нарезку на стороне клиента с риском обрубить предложение.

Субтитры. Экспорт в SRT — заявленная функция, а без тайм-кодов у новой модели её собрать не из чего. Пришлось бы держать два пайплайна: один на gpt-transcribe для текста, второй на whisper-1 для тайм-кодов, и платить за обработку одного файла дважды.

Русский. Ради него всё и затевалось бы, а именно по нему цифр и нет.

Вывод по цифрам получился скучный: остаёмся на turbo-варианте Whisper и ставим себе отметку вернуться к вопросу, когда появятся тайм-коды и хоть какой-то замер на русском. Зато параметр keywords из новой модели — идея, которую стоит подсмотреть: у нас ту же задачу закрывает словарь подстановок, но он работает уже после распознавания, а не подсказывает модели во время.

Пишу это не чтобы объявить победу своего стека. Скорее наоборот: спустя десять дней после громкого релиза итог для продукта на Whisper — «пока ничего не меняем», и это тоже результат разбора.

Что это меняет для тех, кто просто диктует текст?

Почти ничего, и вот почему это стоит проговорить.

Разница между 3,3 и 4,6 процента ошибок — примерно одно слово на сотню. На фразе из двадцати слов, которую вы диктуете в поле сообщения, она не появится вообще. А вот что появится: микрофон в полуметре ото рта вместо десяти сантиметров, гул кондиционера, темп речи под 180 слов в минуту. По замерам из отдельного разбора точности эти три вещи вместе стоят 5–8 пунктов доли верно распознанных слов — в разы больше, чем весь разрыв между лучшей и худшей моделью в таблице выше. Контекстная подсказка и словарь терминов добавляют там же ещё 6–10 пунктов на профессиональной лексике.

Порядок работы отсюда простой: сначала физика записи, потом контекст и словарь, и только потом разговор про модель. Смена модели — это последние проценты, а не первые. Карта способов перевести речь в текст разложена отдельно, там же видно, что выбор между живой диктовкой и транскрибацией готового файла влияет на результат сильнее, чем выбор движка под капотом. Сравнение готовых сервисов по точности на русском — в обзоре восьми сервисов транскрибации.

Тем, кому нужен не API, а готовый инструмент на русском, Диктуй даёт 30 минут бесплатно и без привязки карты: горячая клавиша, речь, текст появляется в активном окне — в Word, браузере, поле задачи. Этого объёма достаточно, чтобы прогнать свою типичную запись и увидеть, в какие проценты попадаете именно вы.

Коротко

OpenAI действительно сместила Whisper с позиции рекомендации по умолчанию, и для тех, кто сидел на whisper-1, это повод пересобрать пайплайн. Но оба заявленных замера сделаны против модели конца 2022 года; на общем для всех аудио разрыв составляет 0,8 пункта, а в независимом рейтинге выше новинки стоят одиннадцать строк, три из которых ещё и дешевле её. Потоковый режим прибавил и вовсе 0,63 пункта. За переезд придётся заплатить тайм-кодами, субтитрами, переводом и семикратной ценой часа против turbo-варианта Whisper.

Русскому языку от этого релиза не досталось ничего проверяемого — ни цифр, ни разбивки. Зато июньская GigaAM Multilingual от Сбера с открытыми весами по-русски выглядит интереснее любого американского анонса этого лета, и про неё почти не написали.

«Если уже перевели свой пайплайн на gpt-transcribe — интересует ровно одно: что сломалось после переезда и на каких записях выигрыш реально видно. Пишите на support@diktuy.ru или в @diktuy_help. Как только соберу замер на русском корпусе, добавлю его в эту статью отдельным разделом с методологией.»
— Михаил Воинский, основатель «Диктуй»

Часто задаваемые вопросы

Что такое gpt-transcribe и чем она отличается от Whisper?

gpt-transcribe — модель распознавания записанной речи, которую OpenAI выпустила 28 июля 2026 вместе с потоковой gpt-live-transcribe. В документации она обозначена как отправная точка для транскрибации файлов, а прежний endpoint whisper-1 оставлен для узких задач. Главные отличия от Whisper: три поля подсказок вместо одного (свободный контекст, список терминов, список ожидаемых языков), заметно лучшее поведение на шумной записи и цена 0,0045 доллара за минуту аудио. Взамен модель потеряла тайм-коды по словам, экспорт субтитров и перевод на английский — это осталось у whisper-1.

Правда ли, что новая модель ошибается вдвое реже Whisper?

Правда для тех двух сравнений, которые сделала сама OpenAI, и обе они против whisper-1. На наборе Common Voice по 22 языкам — 19,27 процента ошибок против 40,37. На наборе Real-World Audio Recording по девяти языкам — 8,98 против 15,21, то есть минус 41 процент. Оговорка в точке отсчёта: whisper-1 — это устаревший endpoint на основе Whisper Large-v2 конца 2022 года, а не Whisper Large-v3-turbo, на котором работают современные десктопные инструменты. Когда обе модели меряет независимая площадка на одних и тех же записях, разрыв между gpt-transcribe и whisper-1 составляет 0,8 пункта: 3,3 процента против 4,1.

Какая модель распознавания речи самая точная в 2026 году?

По независимому индексу AA-WER лидерборда Artificial Analysis на 7 августа 2026 первые места держат Fun-Realtime-ASR-preview от Alibaba с 1,7 процента ошибок, Scribe v2 от ElevenLabs с 2,2 и MAI-Transcribe-1.5 от Microsoft с 2,4. GPT Transcribe с 3,3 процента идёт заметно ниже верхушки: точнее неё в индексе ровно одиннадцать строк, включая Smallest AI Pulse Pro, MAI-Transcribe-1, Voxtral Small от Mistral, Universal-3 Pro от AssemblyAI, Solaria-3 от Gladia и три модели Gemini от Google. Важная оговорка: индекс считается на англоязычных наборах — разговорах с ассистентом, парламентских речах и звонках инвесторам. Русскоязычной части в нём нет, поэтому порядок мест нельзя переносить на русскую речь без отдельной проверки.

Сколько стоит час аудио в gpt-transcribe и есть ли варианты дешевле?

gpt-transcribe стоит 0,0045 доллара за минуту, то есть 0,27 доллара за час аудио — около 22 рублей по курсу ЦБ 81,41 на 7 августа 2026. Потоковая gpt-live-transcribe дороже почти вчетверо: 0,017 доллара за минуту, порядка 1 доллара за час. Дешевле и при этом точнее сразу три модели: Universal-3 Pro за 0,21 доллара за час, Scribe v2 за 0,22 и Voxtral Small за 0,24. А Whisper Large-v3-turbo на инфраструктуре Groq обходится в 0,04 доллара за час — почти в семь раз дешевле при разнице в точности 1,3 пункта.

Работают ли новые модели OpenAI с русским языком?

Русский они распознают, но отдельной цифры по нему нет ни у OpenAI, ни у независимых площадок. Официальные замеры опубликованы средними по 22 и по 9 языкам без разбивки. Индекс AA-WER считается только на английских записях. Собственного замера на русском я тоже пока не делал, поэтому утверждать, что новая модель точнее Whisper именно по-русски, оснований нет. Из того, что известно про русский точно: в июне 2026 Сбер выложил GigaAM Multilingual под лицензией MIT — модель на двух миллионах часов и 70 с лишним языков, заявленную как лучшая среди открытых моделей по ошибкам на русском, казахском, киргизском и узбекском.

Чего gpt-transcribe не умеет по сравнению с whisper-1?

Трёх вещей. Первое — тайм-кодов: параметр timestamp_granularities поддерживается только у whisper-1, поэтому субтитры в форматах SRT и VTT собрать из ответа новой модели нельзя. Второе — перевода: отдельный endpoint переводов работает только с whisper-1 и только на английский. Третье — разделения говорящих: для этого у OpenAI отдельная модель gpt-4o-transcribe-diarize, и в потоковых сессиях метки говорящих не поддерживаются вообще. Плюс общий лимит на файл в 25 мегабайт: часовую запись придётся резать или сжимать.

Какая модель распознавания русской речи лучше работает локально, без облака?

Для запуска на своём железе есть четыре рабочих варианта. Whisper Large-v3-turbo с открытыми весами под лицензией MIT — универсальный выбор, хорошо держит смешанную русско-английскую речь. Реализация faster-whisper на движке CTranslate2 гоняет те же веса кратно быстрее на своей видеокарте: по бенчмарку репозитория 59 секунд против 2 минут 23 секунд на тринадцатиминутном файле, и 2,9 гигабайта видеопамяти вместо 4,7. GigaAM от Сбера, тоже под MIT, заточен под русский и в версии v3 даёт 3,3 процента ошибок, но готового настольного клиента у него нет. Voxtral Small от Mistral под Apache 2.0 точнее всех открытых — 2,8 процента, — однако его 24 миллиарда параметров требуют около 55 гигабайт видеопамяти, то есть это серверный вариант. Учтите общую поправку про облако: цифры лидерборда сняты на развёртывании Groq, где поверх модели работают отсечение тишины и нормализация пунктуации. На русской речи разрыв между локальным запуском turbo и тем же Groq в моих замерах составил 8,1 процента ошибок против 5,6. Ни gpt-transcribe, ни Scribe v2, ни MAI-Transcribe локально не запускаются: веса закрыты, доступ только по API.

Нужно ли переходить на новую модель, если я просто диктую текст?

Скорее нет. Разница между 3,3 и 4,6 процента ошибок — это примерно одно слово на сотню, и на короткой диктовке она почти не заметна. Куда больше решает физика записи: микрофон в 50 сантиметрах ото рта вместо 10–15, гул кондиционера и темп речи под 180 слов в минуту вместе съедают 5–8 пунктов точности, то есть в разы больше разницы между моделями. Плюс контекстные подсказки и словарь подстановок дают ещё 6–10 пунктов на профессиональной лексике. Сначала имеет смысл закрыть эти два слоя, и только потом смотреть на смену модели.