asr ∙ whisper
Распознавание речи 2026: чем заменяют Whisper и что с русским
28 июля OpenAI выпустила GPT Transcribe вместо Whisper. Разбираю независимый замер точности, цену часа аудио и что известно про русскую речь.
28 июля 2026 OpenAI выпустила gpt-transcribe и gpt-live-transcribe и в документации советует начинать с них, а не с Whisper. Заявленное падение ошибок вдвое посчитано против устаревшего whisper-1 — это Whisper Large-v2 конца 2022 года, а не turbo-вариант, на котором работают десктопные инструменты. На независимом индексе AA-WER у gpt-transcribe 3,3% ошибок против 4,1% у whisper-1 и 4,6% у Whisper Large-v3-turbo, а три чужие модели точнее и дешевле неё. Отдельных замеров на русском для новых моделей никто не опубликовал.
Модели распознавания речи за лето 2026 перетасовались сильнее, чем за предыдущие два года, и заметнее всего это видно по одной фразе в документации OpenAI. Раздел про транскрибацию файлов теперь открывается указанием: начинать с gpt-transcribe, а специализированную модель брать, только если нужны метки говорящих, тайм-коды по словам, формат субтитров или перевод на английский. Специализированная модель в этом списке — whisper-1, тот самый Whisper, вокруг которого за четыре года собралась половина индустрии голосового ввода. Из рекомендованного по умолчанию он превратился в запасной вариант для трёх узких задач.
Читайте дальше как мнение заинтересованной стороны: Whisper — модель, на которой работает мой продукт, поэтому статья про то, как её подвинули, для меня не отвлечённая новость, а рабочее решение с ценником. Из-за этого я сознательно держусь опубликованных цифр и независимого лидерборда, а собственную кухню показываю в одном разделе ближе к концу — там, где она к делу.
Три понятия, без которых дальше не разобраться. Распознавание речи — превращение звучащей речи в письменный текст; в англоязычных материалах и названиях моделей эта задача обозначается сокращением ASR (automatic speech recognition, автоматическое распознавание речи). Все современные системы этого класса — нейросети, обученные на десятках и сотнях тысяч часов записей; правил и словарей, как в программах девяностых, внутри у них нет. Качество меряют долей ошибок в словах (word error rate, WER): сколько слов из ста модель заменила, пропустила или добавила. Три процента ошибок — это три неверных слова на сотню, и все цифры ниже именно в этой шкале.
Что именно выпустила OpenAI 28 июля?
28 июля 2026 в API появились две модели распознавания речи. gpt-transcribe работает с готовыми записями и пакетными задачами, gpt-live-transcribe — с потоком из микрофона, звонка или трансляции по WebSocket и WebRTC.
Главное содержательное новшество — не проценты, а способ передать модели контекст. У Whisper для этого было одно поле prompt длиной до 224 токенов. У gpt-transcribe их три, и документация разводит их по назначению:
prompt— свободное описание записи: о чём разговор, кто говорит, какая обстановка;keywords— список точных терминов, которые ожидаются в звуке: артикулы, номера договоров, имена;languages— список кодов языков вместо прежнего одиночногоlanguage, то есть модели прямо говорят, что в записи будет переключение между языками.
Последний пункт стоит отдельного внимания для русскоязычного читателя. Речь разработчика или маркетолога — это русский с английскими вкраплениями вроде deploy, endpoint, retention, и раньше приходилось выбирать одну раскладку на весь файл. Теперь ожидаемый набор языков заявляется списком. Документация при этом предупреждает о жёсткостях: language и languages вместе слать нельзя, а перенос строки или угловая скобка внутри ключевого слова обрушивает весь запрос.
Цены: 0,0045 доллара за минуту у файловой модели и 0,017 доллара за минуту у потоковой. Это 0,27 и примерно 1 доллар за час аудио, то есть около 22 и 83 рублей по курсу ЦБ 81,41 на 7 августа 2026.
Почему «ошибок вдвое меньше» — это не про тот Whisper, что стоит у вас
Заголовок, который разошёлся по новостям: ошибки упали более чем вдвое. Замеров у OpenAI на самом деле два, и оба в её пользу. На наборе Common Voice по 22 языкам — 19,27 процента ошибок против 40,37 у whisper-1. На наборе Real-World Audio Recording по девяти языкам — 8,98 против 15,21, то есть минус 41 процент. Обе цифры компания опубликовала в ленте для разработчиков, и придраться к самим измерениям нечем.
Придраться можно к точке отсчёта. В обоих случаях это whisper-1 — устаревший endpoint OpenAI на основе Whisper Large-v2 конца 2022 года. Модель, на которой реально работают десктопные инструменты голосового ввода, другая: Whisper Large-v3-turbo, вышедшая в октябре 2024 с декодером, укороченным с 32 слоёв до четырёх. Между whisper-1 и turbo-вариантом два поколения и почти два года. Архитектурный разбор самой модели я делал отдельно.
Насколько это меняет картину, видно, когда обе модели меряет кто-то третий и на одних и тех же записях.
Какая модель распознавания речи самая точная в 2026 году
Лидерборд Artificial Analysis считает единый индекс AA-WER: долю ошибок в словах, взвешенную по длительности, на трёх наборах записей — разговоры с ассистентом, парламентские речи и звонки инвесторам. Записи ближе к жизни, чем студийный Common Voice, а моделей в индексе около полусотни.
Картина получается другая. gpt-transcribe даёт 3,3 процента ошибок, whisper-1 — 4,1. Разрыв 0,8 пункта, а не двукратный. Вдвое ошибки падают на собственных наборах OpenAI; на общем для всех аудио прирост есть, но скромный.
И верхушку рейтинга новая модель OpenAI не занимает. Точнее неё в индексе ровно одиннадцать строк: Fun-Realtime-ASR-preview от Alibaba с 1,7 процента, Scribe v2 от ElevenLabs с 2,2, MAI-Transcribe-1.5 от Microsoft и Smallest AI Pulse Pro с 2,4, MAI-Transcribe-1 с 2,6, Voxtral Small от Mistral и Gemini 3.1 Pro Preview от Google с 2,8, Gemini 3 Flash и Gemini 2.5 Pro с 2,9, Universal-3 Pro от AssemblyAI с 3,1 и Solaria-3 от Gladia с 3,2. За лето 2026 сложилась плотная группа моделей точнее того, что предлагает OpenAI, — просто без громких заголовков.
Одна оговорка про этот индекс, которую стоит держать в голове весь оставшийся текст: все три набора записей англоязычные. Русского в нём нет.
Дополнение от 27 августа 2026. В индексе пока нет и двух свежих моделей: Canto от Wispr, показанной 17 августа, и S1-Voice от Superwhisper, вышедшей 19 августа. Обе заявлены самими компаниями, стороннего замера не проходили, и их числа посчитаны по своим методикам — почему их нельзя ставить в один ряд с этой таблицей, разобрано в статье про августовский передел рынка голосового ввода.
Сколько стоит час аудио и где ломается выгода?
Точность без цены ничего не решает, поэтому те же модели полезно посмотреть в двух координатах сразу.
В таблице семь моделей из примерно полусотни оценённых — те, что нужны для сравнения с новинкой; полный список точнее неё идёт ниже. Из таблицы вылезает главное неудобное для новинки наблюдение: Universal-3 Pro, Scribe v2 и Voxtral Small обходят gpt-transcribe сразу по обеим осям — они и точнее, и дешевле, и при этом сохранили тайм-коды. Рекомендация в документации OpenAI, разумеется, про её собственную линейку, а не про рынок целиком, и путать одно с другим не стоит.
Со стороны дешёвого края всё держит Whisper Large-v3-turbo на инфраструктуре Groq: 0,04 доллара за час против 0,27 у gpt-transcribe, разница почти семикратная при 1,3 пункта в точности — примерно одно ошибочное слово на сотню.
Дальше арифметика объёма. На десяти часах аудио в месяц разница между этими вариантами — 2,3 доллара, меньше двухсот рублей, и о ней незачем думать. На пятистах часах счёт выходит 135 долларов против 20, и вопрос «стоит ли одно слово из сотни лишних 115 долларов в месяц» становится содержательным. Дороже всех при этом выходит именно whisper-1: 0,36 доллара за час при 4,1 процента ошибок — худшее сочетание в таблице. Тем, кто до сих пор сидит на нём, переезжать действительно пора, только необязательно на gpt-transcribe.
Потоковый режим — отдельная история. gpt-live-transcribe даёт 19,70 процента ошибок на том же Common Voice против 20,33 у прежней потоковой модели gpt-realtime-whisper. Прирост 0,63 пункта при неизменной цене 0,017 доллара за минуту. Прорыв случился в пакетной обработке, а не в живой. Разбор прежнего потокового стека OpenAI с ценами и сценариями — в отдельной статье.
Чего gpt-transcribe не умеет по сравнению с whisper-1?
Список короткий, но для части задач блокирующий.
Нет тайм-кодов. Параметр timestamp_granularities поддерживается только у whisper-1. Значит, из ответа новой модели нельзя собрать субтитры SRT и VTT: не к чему привязывать реплики. Для тех, кто делает субтитры к видео, это отменяет переезд целиком — пошаговый разбор такого сценария построен как раз вокруг файла с тайм-кодами.
Нет перевода. Endpoint переводов работает только с whisper-1 и только на английский.
Нет разделения говорящих. Для меток спикеров у OpenAI отдельная модель gpt-4o-transcribe-diarize с форматом ответа diarized_json; ей можно подсунуть до четырёх образцов голоса длиной 2–10 секунд, чтобы сопоставить сегменты с известными людьми. В потоковых сессиях разделение говорящих не поддерживается вообще.
Файл до 25 мегабайт. Часовая запись в приличном качестве в этот лимит не помещается, и её надо либо сжимать, либо резать на куски. Документация отдельно предупреждает не резать посреди предложения: обрубленный контекст роняет точность.
Что известно про распознавание русской речи?
Прямой ответ: цифр нет ни у кого, включая меня.
OpenAI опубликовала две общие средние — по 22 языкам Common Voice и по девяти языкам Real-World Audio — без разбивки по языкам. Индекс AA-WER считается на английских записях. Российские публикации про релиз, включая новость на Хабре, пересказывают те же общие цифры. Своего замера на русском я тоже пока не делал, поэтому фразу «новая модель точнее Whisper по-русски» произносить не буду: под ней нет ничего, кроме экстраполяции.
Что про русский известно точно, так это две вещи. Первая — на русской речи без помех и специальной лексики Whisper-семейство держит около 5–6 процентов ошибок в turbo-варианте, а заточенная под русский GigaAM v3 от Сбера — 3,3 процента; расклад по нескольким моделям с методологией замера сведён в разборе точности голосового ввода.
Вторая — в июне 2026 Сбер выложил GigaAM Multilingual: кодировщики на 220 и 600 миллионов параметров, предобучение на двух миллионах часов, 70 с лишним языков, лицензия MIT. Разработчики заявляют лучшее качество среди открытых моделей по ошибкам на русском, казахском, киргизском и узбекском. Готового настольного клиента у неё нет, разворачивать надо самому, но для серверной обработки русского это самый интересный релиз лета — и он прошёл почти без внимания, в отличие от американских.
Похоже, русский сейчас находится в положении, когда общие рейтинги про него ничего не говорят, а заточенные под него модели остаются уделом тех, кто готов собирать пайплайн руками.
Локальное распознавание речи: что можно запустить у себя
Отдельная развилка, которая после этого релиза стала заметнее. Ни gpt-transcribe, ни Scribe v2, ни MAI-Transcribe локально не запускаются: веса закрыты, доступ только по API. Как только требование «звук не покидает компьютер» становится жёстким — из-за врачебной тайны, адвокатской тайны или внутренней политики компании, — весь верх рейтинга отпадает целиком, и выбирать приходится среди открытых моделей.
Вариантов четыре, и они закрывают разные задачи.
Whisper Large-v3-turbo под лицензией MIT — универсальный выбор: 99 языков в обучении, устойчивое поведение на смеси русского с английскими терминами. Важная поправка к цифрам выше: 4,6 процента ошибок в таблице — это развёртывание на Groq, где поверх модели навешены отсечение тишины фильтром Silero и нормализация пунктуации языковой моделью. Голая модель у себя работает хуже: на русском разница между локальным запуском и Groq в моих замерах составила 8,1 процента против 5,6. По скорости на MacBook Air M2 минута записи расшифровывается за 7–9 секунд, на ноутбуке с Intel без видеокарты — за полминуты и больше; замеры на конкретном железе есть в разборе открытых настольных решений.
faster-whisper — не отдельная модель, а другой движок для тех же весов: реализация на CTranslate2. По бенчмарку репозитория на видеокарте RTX 3070 Ti тринадцатиминутный файл проходит за 1 минуту 3 секунды против 2 минут 23 секунд у обычной реализации, а в режиме INT8 — за 59 секунд при 2,9 гигабайта видеопамяти вместо 4,7. Замер снят на весах Large-v2, но выигрыш движка переносится и на turbo. Вариант для тех, кто поднимает собственный сервер, а не диктует за ноутбуком.
GigaAM от Сбера, тоже MIT, — единственный из четырёх, заточенный под русский: 3,3 процента ошибок в версии v3. Обновление апреля 2026 добавило тайм-коды по словам и поддержку Triton Inference Server. Цена вопроса — отсутствие готового приложения: всё собирается руками.
Voxtral Small от Mistral под лицензией Apache 2.0 — формально самая точная из открытых, 2,8 процента в индексе, но с оговоркой про железо: 24 миллиарда параметров требуют порядка 55 гигабайт видеопамяти, то есть это серверный вариант, а не «поставил на ноутбук». Для устройств у Mistral есть отдельная младшая версия на 3 миллиарда параметров.
Готовые настольные программы, которые крутят локальный Whisper без единой строчки кода, разобраны в обзоре открытых решений для голосового ввода.
Раз уж речь зашла о врачебной и адвокатской тайне, скажу прямо про свой продукт: Диктуй облачный, звук уходит на распознавание, и для материалов, которые по закону не должны покидать компьютер, он не подходит — тут нужны именно локальные варианты из этого раздела.
Как подключиться к новым моделям из России
Прямая оплата OpenAI российской картой не проходит, ни МИР, ни СБП. Рабочая схема прежняя: рублёвые агрегаторы доступа к API — ProxyAPI, GenAPI, AITunnel, Vsegpt, Polza AI. Они проксируют запросы через свою инфраструктуру, принимают рубли через ЮKassa и СБП и выдают фискальный чек ОФД, что закрывает вопрос учёта для ИП и ООО. Наценка к тарифу OpenAI обычно 10–25 процентов.
Один нюанс, на котором легко потерять день: свежие модели доезжают до каталогов агрегаторов с задержкой в дни или недели. Перед пополнением баланса стоит открыть каталог и убедиться, что там появились именно gpt-transcribe и gpt-live-transcribe, а не только прежние gpt-4o-transcribe и whisper-1. В коде при этом меняется только адрес endpoint и ключ — вызовы openai-python и openai-node остаются как были.
Меняю ли я модель под своим продуктом?
Тот раздел, где я перестаю быть наблюдателем. Диктуй — настольная программа голосового ввода и транскрибации для Windows и macOS, работает на Whisper Large-v3-turbo, и вопрос «переезжать ли на gpt-transcribe» я решал не как редактор, а как человек, который платит за инференс.
Разложил на четыре пункта.
Цена. Семикратный рост стоимости часа при разнице 1,3 пункта в точности. На нашем объёме это ощутимая статья расходов ради прибавки, которую пользователь на короткой диктовке не заметит.
Лимит файла. Транскрибация в продукте принимает записи до двух часов; в 25 мегабайт такое не влезает, и пришлось бы городить нарезку на стороне клиента с риском обрубить предложение.
Субтитры. Экспорт в SRT — заявленная функция, а без тайм-кодов у новой модели её собрать не из чего. Пришлось бы держать два пайплайна: один на gpt-transcribe для текста, второй на whisper-1 для тайм-кодов, и платить за обработку одного файла дважды.
Русский. Ради него всё и затевалось бы, а именно по нему цифр и нет.
Вывод по цифрам получился скучный: остаёмся на turbo-варианте Whisper и ставим себе отметку вернуться к вопросу, когда появятся тайм-коды и хоть какой-то замер на русском. Зато параметр keywords из новой модели — идея, которую стоит подсмотреть: у нас ту же задачу закрывает словарь подстановок, но он работает уже после распознавания, а не подсказывает модели во время.
Пишу это не чтобы объявить победу своего стека. Скорее наоборот: спустя десять дней после громкого релиза итог для продукта на Whisper — «пока ничего не меняем», и это тоже результат разбора.
Что это меняет для тех, кто просто диктует текст?
Почти ничего, и вот почему это стоит проговорить.
Разница между 3,3 и 4,6 процента ошибок — примерно одно слово на сотню. На фразе из двадцати слов, которую вы диктуете в поле сообщения, она не появится вообще. А вот что появится: микрофон в полуметре ото рта вместо десяти сантиметров, гул кондиционера, темп речи под 180 слов в минуту. По замерам из отдельного разбора точности эти три вещи вместе стоят 5–8 пунктов доли верно распознанных слов — в разы больше, чем весь разрыв между лучшей и худшей моделью в таблице выше. Контекстная подсказка и словарь терминов добавляют там же ещё 6–10 пунктов на профессиональной лексике.
Порядок работы отсюда простой: сначала физика записи, потом контекст и словарь, и только потом разговор про модель. Смена модели — это последние проценты, а не первые. Карта способов перевести речь в текст разложена отдельно, там же видно, что выбор между живой диктовкой и транскрибацией готового файла влияет на результат сильнее, чем выбор движка под капотом. Сравнение готовых сервисов по точности на русском — в обзоре восьми сервисов транскрибации.
Тем, кому нужен не API, а готовый инструмент на русском, Диктуй даёт 30 минут бесплатно и без привязки карты: горячая клавиша, речь, текст появляется в активном окне — в Word, браузере, поле задачи. Этого объёма достаточно, чтобы прогнать свою типичную запись и увидеть, в какие проценты попадаете именно вы.
Коротко
OpenAI действительно сместила Whisper с позиции рекомендации по умолчанию, и для тех, кто сидел на whisper-1, это повод пересобрать пайплайн. Но оба заявленных замера сделаны против модели конца 2022 года; на общем для всех аудио разрыв составляет 0,8 пункта, а в независимом рейтинге выше новинки стоят одиннадцать строк, три из которых ещё и дешевле её. Потоковый режим прибавил и вовсе 0,63 пункта. За переезд придётся заплатить тайм-кодами, субтитрами, переводом и семикратной ценой часа против turbo-варианта Whisper.
Русскому языку от этого релиза не досталось ничего проверяемого — ни цифр, ни разбивки. Зато июньская GigaAM Multilingual от Сбера с открытыми весами по-русски выглядит интереснее любого американского анонса этого лета, и про неё почти не написали.
«Если уже перевели свой пайплайн на gpt-transcribe — интересует ровно одно: что сломалось после переезда и на каких записях выигрыш реально видно. Пишите на support@diktuy.ru или в @diktuy_help. Как только соберу замер на русском корпусе, добавлю его в эту статью отдельным разделом с методологией.»— Михаил Воинский, основатель «Диктуй»
Часто задаваемые вопросы
Что такое gpt-transcribe и чем она отличается от Whisper?
gpt-transcribe — модель распознавания записанной речи, которую OpenAI выпустила 28 июля 2026 вместе с потоковой gpt-live-transcribe. В документации она обозначена как отправная точка для транскрибации файлов, а прежний endpoint whisper-1 оставлен для узких задач. Главные отличия от Whisper: три поля подсказок вместо одного (свободный контекст, список терминов, список ожидаемых языков), заметно лучшее поведение на шумной записи и цена 0,0045 доллара за минуту аудио. Взамен модель потеряла тайм-коды по словам, экспорт субтитров и перевод на английский — это осталось у whisper-1.
Правда ли, что новая модель ошибается вдвое реже Whisper?
Правда для тех двух сравнений, которые сделала сама OpenAI, и обе они против whisper-1. На наборе Common Voice по 22 языкам — 19,27 процента ошибок против 40,37. На наборе Real-World Audio Recording по девяти языкам — 8,98 против 15,21, то есть минус 41 процент. Оговорка в точке отсчёта: whisper-1 — это устаревший endpoint на основе Whisper Large-v2 конца 2022 года, а не Whisper Large-v3-turbo, на котором работают современные десктопные инструменты. Когда обе модели меряет независимая площадка на одних и тех же записях, разрыв между gpt-transcribe и whisper-1 составляет 0,8 пункта: 3,3 процента против 4,1.
Какая модель распознавания речи самая точная в 2026 году?
По независимому индексу AA-WER лидерборда Artificial Analysis на 7 августа 2026 первые места держат Fun-Realtime-ASR-preview от Alibaba с 1,7 процента ошибок, Scribe v2 от ElevenLabs с 2,2 и MAI-Transcribe-1.5 от Microsoft с 2,4. GPT Transcribe с 3,3 процента идёт заметно ниже верхушки: точнее неё в индексе ровно одиннадцать строк, включая Smallest AI Pulse Pro, MAI-Transcribe-1, Voxtral Small от Mistral, Universal-3 Pro от AssemblyAI, Solaria-3 от Gladia и три модели Gemini от Google. Важная оговорка: индекс считается на англоязычных наборах — разговорах с ассистентом, парламентских речах и звонках инвесторам. Русскоязычной части в нём нет, поэтому порядок мест нельзя переносить на русскую речь без отдельной проверки.
Сколько стоит час аудио в gpt-transcribe и есть ли варианты дешевле?
gpt-transcribe стоит 0,0045 доллара за минуту, то есть 0,27 доллара за час аудио — около 22 рублей по курсу ЦБ 81,41 на 7 августа 2026. Потоковая gpt-live-transcribe дороже почти вчетверо: 0,017 доллара за минуту, порядка 1 доллара за час. Дешевле и при этом точнее сразу три модели: Universal-3 Pro за 0,21 доллара за час, Scribe v2 за 0,22 и Voxtral Small за 0,24. А Whisper Large-v3-turbo на инфраструктуре Groq обходится в 0,04 доллара за час — почти в семь раз дешевле при разнице в точности 1,3 пункта.
Работают ли новые модели OpenAI с русским языком?
Русский они распознают, но отдельной цифры по нему нет ни у OpenAI, ни у независимых площадок. Официальные замеры опубликованы средними по 22 и по 9 языкам без разбивки. Индекс AA-WER считается только на английских записях. Собственного замера на русском я тоже пока не делал, поэтому утверждать, что новая модель точнее Whisper именно по-русски, оснований нет. Из того, что известно про русский точно: в июне 2026 Сбер выложил GigaAM Multilingual под лицензией MIT — модель на двух миллионах часов и 70 с лишним языков, заявленную как лучшая среди открытых моделей по ошибкам на русском, казахском, киргизском и узбекском.
Чего gpt-transcribe не умеет по сравнению с whisper-1?
Трёх вещей. Первое — тайм-кодов: параметр timestamp_granularities поддерживается только у whisper-1, поэтому субтитры в форматах SRT и VTT собрать из ответа новой модели нельзя. Второе — перевода: отдельный endpoint переводов работает только с whisper-1 и только на английский. Третье — разделения говорящих: для этого у OpenAI отдельная модель gpt-4o-transcribe-diarize, и в потоковых сессиях метки говорящих не поддерживаются вообще. Плюс общий лимит на файл в 25 мегабайт: часовую запись придётся резать или сжимать.
Какая модель распознавания русской речи лучше работает локально, без облака?
Для запуска на своём железе есть четыре рабочих варианта. Whisper Large-v3-turbo с открытыми весами под лицензией MIT — универсальный выбор, хорошо держит смешанную русско-английскую речь. Реализация faster-whisper на движке CTranslate2 гоняет те же веса кратно быстрее на своей видеокарте: по бенчмарку репозитория 59 секунд против 2 минут 23 секунд на тринадцатиминутном файле, и 2,9 гигабайта видеопамяти вместо 4,7. GigaAM от Сбера, тоже под MIT, заточен под русский и в версии v3 даёт 3,3 процента ошибок, но готового настольного клиента у него нет. Voxtral Small от Mistral под Apache 2.0 точнее всех открытых — 2,8 процента, — однако его 24 миллиарда параметров требуют около 55 гигабайт видеопамяти, то есть это серверный вариант. Учтите общую поправку про облако: цифры лидерборда сняты на развёртывании Groq, где поверх модели работают отсечение тишины и нормализация пунктуации. На русской речи разрыв между локальным запуском turbo и тем же Groq в моих замерах составил 8,1 процента ошибок против 5,6. Ни gpt-transcribe, ни Scribe v2, ни MAI-Transcribe локально не запускаются: веса закрыты, доступ только по API.
Нужно ли переходить на новую модель, если я просто диктую текст?
Скорее нет. Разница между 3,3 и 4,6 процента ошибок — это примерно одно слово на сотню, и на короткой диктовке она почти не заметна. Куда больше решает физика записи: микрофон в 50 сантиметрах ото рта вместо 10–15, гул кондиционера и темп речи под 180 слов в минуту вместе съедают 5–8 пунктов точности, то есть в разы больше разницы между моделями. Плюс контекстные подсказки и словарь подстановок дают ещё 6–10 пунктов на профессиональной лексике. Сначала имеет смысл закрыть эти два слоя, и только потом смотреть на смену модели.