Диктуй

голосовой ввод ∙ superwhisper

Голосовой ввод на компьютере: чем диктовать по-русски в 2026

Разбираю, чем диктовать текст на компьютере по-русски в 2026 и что изменил август: $280 млн у Wispr, своя модель Canto и открытые веса у Superwhisper.

11 минут чтенияавтор Михаил Воинский, основатель Диктуй
Коротко

Чем диктовать по-русски на компьютере, за август 2026 не изменилось: встроенные Win+H и системная диктовка macOS бесплатны, локальные решения с открытым кодом не отправляют звук в сеть, облачные приложения удобнее и требуют подписки. При этом 17 августа Wispr привлекла $280 млн при оценке $2 млрд и показала свою модель распознавания Canto, а 19 августа Superwhisper выпустила семейство S1. Обе новости про англоязычный продукт: проверяемых цифр по русской речи в них нет.

Новую модель распознавания Wispr показала не на пустом месте. Несколько месяцев подряд в отзывах на её приложение повторялась одна и та же претензия: качество диктовки у части платных пользователей поехало вниз. Один из них, надиктовавший больше 350 тысяч слов с начала года, в пользовательском обзоре за 2026 год отдельно оговаривался, что дело не в микрофоне — он пишет на студийный Elgato Wave 3, а не на наушники. И вот 17 августа 2026 компания объявляет о раунде на $280 млн, а в том же сообщении показывает Canto — первую собственную модель распознавания за всю историю продукта.

Место, с которого я на это смотрю, стоит обозначить до того, как пойдут цифры. Wispr делает ровно то же, что делаю я, только для другого рынка: у меня Диктуй — голосовой ввод на компьютере с рублёвой оплатой и русским интерфейсом. Хвалить чужой раунд мне незачем, а ругать его — тем более подозрительно, поэтому по фактам держусь блогов обеих компаний, TechCrunch и открытых карточек моделей, а собственный продукт трогаю в одном разделе.

Запись «Our Series B, and what it means for you» в блоге Wispr от 17 августа 2026 — первоисточник цифр. Здесь же названы все инвесторы раунда и общая сумма привлечённого: $361 млн.

Что произошло за четыре дня августа?

17 августа Wispr объявила о раунде Series B на $280 млн при оценке $2 млрд под ведением Menlo Ventures; всего компания привлекла $361 млн. Со-основатель и генеральный директор Танай Котхари приводит там два показателя масштаба: через Flow надиктовано более 60 млрд слов, продукт используют свыше 10 тысяч компаний. Тогда же показано превью Canto. Через два дня Superwhisper выпустила семейство S1 сразу из трёх моделей.

ДатаКомпанияЧто показалиГде работает
17 августаWisprРаунд $280 млн, оценка $2 млрд
17 августаWisprCanto — своя модель распознаванияпревью, сроки не названы
19 августаSuperwhisperS1-Voice — облачное распознаваниеподписка
19 августаSuperwhisperS1-Language — обработка текстаподписка
19 августаSuperwhisperS1-mini — нормализатор текстаоткрытые веса, локально

Общее в этих двух новостях важнее, чем каждая по отдельности. Оба продукта до сих пор строились в основном на чужих моделях распознавания, и оба за одну неделю показали свои. Фундамент, на котором четыре года стояла вся ниша, перестал быть общим.

Три цифры точности, которые нельзя ставить рядом

Из августовских сообщений разошлись три числа, и в пересказах они встали в один ряд, хотя сравнивать их нельзя ни в какой паре.

Три цифры точности из одних и тех же августовских новостей. Canto меряли на тяжёлом звуке, S1-Voice — на восьми наборах записей, у индекса AA-WER 1,7–4,6% — это верхние строки полусотни моделей на английской речи. Ни одна пара в этом ряду не сравнима напрямую.

Canto: «с 30% до 5–10%». Цифра описывает поведение на тяжёлом звуке — уличный шум, ветер, сильный акцент. Тридцать процентов ошибок это не «как было вообще», а «как бывает, когда вы диктуете на ветру». Wispr отдельно оценивает эффект в примерно треть диктовок, которые больше не приходится править руками. Замер сделан самой компанией, методика не опубликована.

S1-Voice: «6,8% в среднем». Superwhisper прогнала модель по восьми наборам записей — встречи, звонки инвесторам, спонтанная речь — и получила 6,8% ошибок в словах, назвав это лучшим результатом среди пятнадцати проверенных моделей. На начитанном LibriSpeech та же модель даёт 2,2%. Разброс между двумя числами одной модели наглядно показывает, насколько цифра точности зависит от звука, а не только от модели.

Верхние строки индекса AA-WER: 1,7–4,6%. Лидерборд Artificial Analysis считает около полусотни моделей по единой методике, и потому числа его верхушки выглядят ниже. Ни Canto, ни S1-Voice в него на момент написания не входят: обе новинки заявлены самими компаниями и стороннего замера пока не проходили. Подробный разбор этого индекса с ценами за час аудио я делал в отдельной статье про модели распознавания речи.

Практический вывод из всех трёх: заявление «доля ошибок упала вдвое» без указания, на каком звуке и кем меряли, сегодня не значит почти ничего. Это относится и к цифрам, которые публикую я.

Зачем Superwhisper отдала нормализатор с открытыми весами?

Самая содержательная часть августа — не деньги, а то, как Superwhisper разложила диктовку на слои и один из них выложила наружу.

Диктовка на компьютере состоит из двух разных задач. Первая — распознавание: превратить звук в последовательность слов. Вторая — нормализация: превратить эту последовательность в текст, который не стыдно отправить. Разница между ними заметнее, чем кажется. Расшифровка живой речи выглядит примерно так: «ну то есть нам нужно... нет, не пятнадцать, семнадцать штук к пятнице». Письменный вид того же: «Нам нужно 17 штук к пятнице». Слова распознаны верно в обоих случаях; читаемым текст делает второй слой.

S1-mini закрывает ровно этот второй слой и больше ничего. Речь она не распознаёт и на вопросы не отвечает — принимает готовую расшифровку и переписывает её начисто: убирает паразиты, разрешает самопоправки в пользу того варианта, на котором говорящий остановился, расставляет знаки препинания и заглавные, переводит проговоренные числа, даты, суммы и адреса почты в письменный вид. Управление устроено тремя независимыми осями: тон (от разговорного до формального), структура (проза или списки), назначение (обычный текст или письмо).

Технические параметры: 0,6 млрд параметров, дообучена из Qwen3-0.6B, лицензия Apache 2.0 с оговоркой о сохранении имени модели. Квантованная сборка занимает 462 МиБ и работает на процессоре ноутбука без видеокарты. Заявленная точность — 94,8% верно предсказанных токенов на собственном наборе из 7519 английских примеров.

Открытые веса тут не жест доброй воли. Платная услуга остаётся в облачных S1-Voice и S1-Language, а маленькая бесплатная модель показывает подход и снимает у скептиков вопрос «что там внутри». Русскому пользователю от неё пока пользы мало: первая версия понимает только английский, а специализированной модели такого класса для русского текста я не нашёл — эту работу у нас продолжают делать большие языковые модели общего назначения, дороже и медленнее полугигабайтной.

Что все эти цифры говорят про русский?

Ничего. И это стоит проговорить прямо, потому что новость подавалась как событие для всей отрасли.

Wispr публикует прирост Canto без разбивки по языкам. Пример переключения языков внутри фразы в её материалах — смесь английского с хинди. Superwhisper указывает в карточке модели: S1-mini в первой версии поддерживает только английский. Из наборов, на которых мерили S1-Voice, по имени назван англоязычный LibriSpeech. Индекс AA-WER считается на английской речи.

При этом аудитория у таких продуктов сильно не англоязычная: по собственным данным Wispr, приложение поддерживает больше сотни языков, а доля английского в использовании — около 40%. То есть большинство диктовок в мире идёт не на английском, а все публикуемые цифры точности — про английский. Разрыв между этими двумя фактами и есть то место, где живёт русскоязычный пользователь.

Чем диктовать текст на компьютере на русском в 2026?

Набор рабочих способов за эти четыре дня не изменился, и их по-прежнему три. Ниже — что каждый даёт и где упирается.

Бесплатный голосовой ввод: Win+H и системная диктовка macOS

Он уже установлен. В Windows сочетание Win+H открывает панель голосового ввода в любом текстовом поле; русский включается в языковых параметрах. В macOS то же делает системная диктовка из раздела «Клавиатура» в системных настройках. Ни регистрации, ни подписки, ни установки.

Упирается это в три вещи: знаки препинания на длинных текстах, английские термины внутри русской фразы и полное отсутствие обработки надиктованного — что сказали, то и вставилось. Для сообщения в мессенджер хватает, для статьи или письма клиенту обычно нет. Что Microsoft добавила в диктовку за лето и кому это досталось, разобрано в статье про Fluid Dictation.

Локальное с открытым исходным кодом

Модель крутится на самом компьютере, звук не уходит в сеть вообще. Единственный подходящий вариант там, где запись по закону или внутренней политике не должна покидать машину: врачебная тайна, адвокатская тайна, закрытый контур. Плата за это — разовая установка модели весом от полугигабайта, английский интерфейс у большинства проектов и заметная нагрузка на процессор. Готовые настольные программы такого рода я разбирал в обзоре открытых решений.

Облачные программы и приложения для голосового ввода

Здесь живут Wispr Flow, Superwhisper и Диктуй — мой продукт: горячая клавиша, речь, текст появляется в активном окне, оплата в рублях, интерфейс и поддержка на русском.

Про деньги коротко. Тариф Pro у Wispr Flow — $15 за пользователя в месяц, $12 при годовой оплате; платёж идёт через Stripe, российские карты он не принимает. Подробный разбор способов оплаты из России со всеми комиссиями у меня написан отдельно. Русского интерфейса и рублёвой оплаты не появилось ни у Wispr, ни у Superwhisper, и ни в одном из августовских сообщений про российский рынок нет ни слова.

Про второй слой, о котором шла речь выше, скажу как есть. Своей модели распознавания у меня нет — Диктуй работает на открытой модели Whisper, и августовские новости этого не изменили; почему выбрана именно она, разобрано в отдельном техническом разборе. А слой приведения текста в порядок закрыт Режимом трансформации: выделяешь надиктованный кусок, отдельной клавишей даёшь голосом инструкцию — «убери повторы, оформи деловым письмом» — и модель переписывает. По сути та же задача, что решает S1-Language, только инструкция задаётся голосом, а не тремя переключателями, и работает она на русском.

Честные границы тоже назову. Диктуй облачный: звук уходит на распознавание, и для материалов, которые не должны покидать компьютер, он не подходит — там нужен локальный вариант из предыдущего пункта. Мобильных приложений у меня нет, у Wispr они есть. Собственной модели, как теперь у обеих упомянутых компаний, тоже нет.

Выбирать между тремя слоями по чужим процентам бессмысленно — разброс между ними меньше, чем разброс между вашими условиями записи. Расстояние до микрофона, фон и темп речи дают больший эффект, чем разница между любыми двумя моделями из таблиц выше; с замерами это разобрано в статье про ошибки голосового ввода. Практичнее взять свою типичную задачу и прогнать её на бесплатном уровне: 30 минут диктовки без привязки карты покрывают десяток реальных писем и заметок, после которых видно, экономит голос время или нет.

Насколько на самом деле выросла оценка?

Цифра $2 млрд разошлась по заголовкам без второй половины сравнения. Девятью месяцами раньше, в ноябре 2025 года, Reuters сообщал об оценке компании в $700 млн по итогам предыдущего раунда. Рост почти втрое.

Оценка Wispr выросла с $700 млн в ноябре 2025 до $2 млрд 17 августа 2026 — почти втрое за девять месяцев. Это оценка компании инвесторами, а не её выручка и не размер рынка диктовки.

Два понятия в пересказах слипаются. Оценка компании — величина, из которой считается доля инвестора за вложенные деньги, то есть ожидания. Выручка — то, что реально получено от клиентов; абсолютных цифр Wispr не публикует, но раскрыла динамику: рост более чем на 150% в каждом из четырёх последних кварталов. Формулировка «сервис диктовки стоит два миллиарда» описывает первое, а читается как второе.

Означает оценка вот что: инвесторы перестали считать голосовой ввод функцией внутри чужой операционной системы. TechCrunch в разборе раунда перечисляет целую группу конкурентов, за которыми теперь следят: Willow, Monologue, Aqua, Superwhisper, а со стороны расшифровки встреч — Granola, Fireflies, Read AI. Четыре года назад такого списка не существовало.

Почему Wispr уходит от диктовки

Русские пересказы новости вышли под заголовками про замену клавиатуры. Первоисточник говорит о другом: диктовка для компании становится не конечным продуктом, а входной точкой. Вышел Notetaker — расшифровка встреч с итогами и списком задач, то есть выход на поляну Granola и Fireflies. Появились партнёрства с производителями носимых устройств, включая кольцо Oasis для диктовки без рук. Про саму Canto Котхари пишет, что модель — только начало пути к диктовке, которую не приходится править. Та же убеждённость, по его словам, стоит и за исследовательским подразделением Wispr Advanced Interfaces Lab, которое компания открыла 24 июля 2026 во главе с Арией Растроу, участником команды, создавшей Alexa. Цель там сформулирована как системы, которые понимают не произнесённые слова, а намерение.

Для пользователя, которому нужно просто надиктовать письмо, это скорее предупреждение: продукт, который берёт деньги за диктовку, направляет новые $280 млн в соседние задачи. Хорошая новость в том, что в нише остаются те, для кого диктовка и есть продукт.

Коротко

Голосовой ввод за неделю августа перестал быть надстройкой над чужими моделями. Wispr привлекла $280 млн при оценке $2 млрд — почти втрое выше ноябрьской — и показала первую собственную модель распознавания Canto, ответив ею на месяцами копившиеся претензии к качеству. Superwhisper двумя днями позже выпустила своё семейство S1 и выложила нормализатор текста с открытыми весами, разделив диктовку на два честно названных слоя.

Русскому языку из этого не досталось ни одной проверяемой цифры: замеры Canto без разбивки по языкам, S1-mini в первой версии только английский, индекс AA-WER на английской речи. Оценка в два миллиарда описывает ожидания инвесторов от англоязычного продукта, а способов надиктовать русский текст на компьютере как было три, так и осталось — встроенный бесплатный, локальный открытый, облачный с подпиской.

«Если пользуетесь Flow или Superwhisper на русском — интересно ровно одно: заметили ли вы разницу после августовских обновлений на своих записях. Пишите на support@diktuy.ru или в @diktuy_help. Появятся замеры Canto или S1-Voice на русской речи — добавлю их сюда отдельным разделом.»
— Михаил Воинский, основатель «Диктуй»

Часто задаваемые вопросы

Чем диктовать текст на компьютере на русском в 2026?

Рабочих слоёв три. Встроенное и бесплатное: Win+H в Windows и системная диктовка в macOS, обе понимают русский, обе заметно проседают на технической лексике и переключении между языками внутри фразы. Локальное с открытым исходным кодом: модель крутится прямо на компьютере, звук никуда не уходит — единственный подходящий вариант, когда запись по закону или внутренней политике не должна покидать машину. Облачные приложения: удобнее остальных, распознают точнее, требуют подписки и интернета; здесь есть и зарубежные с оплатой в валюте, и российские с рублёвой оплатой. Августовские релизы Wispr и Superwhisper этот набор не изменили — обе новинки живут в англоязычном контуре.

Есть ли бесплатный голосовой ввод на компьютере?

Да, и он уже установлен. В Windows сочетание Win+H открывает панель голосового ввода в любом текстовом поле, русский поддерживается и включается в языковых параметрах. В macOS то же самое делает системная диктовка, включается в разделе «Клавиатура» системных настроек. Оба варианта бесплатны, не требуют регистрации и покрывают короткие сообщения и заметки. Ограничения проявляются на длинных текстах и профессиональной лексике: встроенные средства хуже расставляют знаки препинания, спотыкаются на английских терминах внутри русской фразы и не умеют переписывать надиктованное. У платных приложений тоже почти всегда есть бесплатный уровень — например, Wispr Flow даёт 2000 слов в неделю на компьютере.

Какая программа для голосового ввода лучше на русском?

Единого ответа нет: три класса программ решают разные задачи. Для коротких сообщений и заметок лучшая программа та, что уже стоит, — Win+H или системная диктовка macOS, платить не за что. Для конфиденциальных записей нужно приложение с локальной моделью, где звук не покидает компьютер, даже ценой английского интерфейса и нагрузки на процессор. Для ежедневной работы с длинными текстами удобнее облачное приложение: точнее распознавание, обработка надиктованного, словарь терминов. Выбирать между ними по чужим процентам точности бессмысленно — разброс между условиями вашей записи больше, чем между самими программами. Практичнее прогнать одну свою типичную задачу на бесплатном уровне каждого варианта и сравнить результат.

Что произошло с голосовым вводом в августе 2026?

Два события за четыре дня. 17 августа Wispr, разработчик приложения Flow, объявила о раунде Series B на $280 млн при оценке $2 млрд и показала превью собственной модели распознавания Canto. 19 августа Superwhisper выпустила семейство моделей S1: облачное распознавание S1-Voice, облачную модель обработки текста S1-Language и локальный нормализатор S1-mini, выложенный с открытыми весами на Hugging Face. Обе компании делают приложения для голосового ввода на компьютере, и обе до этого опирались в основном на чужие модели распознавания.

Значит ли оценка в $2 млрд, что рынок голосового ввода стоит два миллиарда?

Нет, это две разные величины. $2 млрд — оценка одной компании, Wispr, по итогам сделки с инвесторами: сумма, из которой считается доля за вложенные деньги. Ни выручкой, ни размером рынка она не является. Абсолютных цифр выручки Wispr не публикует, но вместе с раундом раскрыла её динамику: рост более чем на 150% в каждом из четырёх последних кварталов. Про рынок диктовки в целом оценка говорит одно: инвесторы считают направление достаточно большим, чтобы платить за долю в нём почти втрое дороже, чем девять месяцев назад.

Что такое Canto и насколько она точнее прежних моделей?

Canto — первая собственная модель распознавания речи Wispr, показанная в превью 17 августа 2026. Компания заявляет, что на тяжёлом звуке — уличный шум, ветер, сильный акцент — доля ошибок в словах падает с 30% и выше до 5–10%, а число диктовок, которые приходится править руками, сокращается примерно на треть. Модель заявлена как умеющая переключение между языками внутри фразы, пользовательские словари и распознавание имён из адресной книги. Важная оговорка: цифра описывает поведение в сложных условиях, а не общую точность. Ставить её рядом с рейтингами вроде AA-WER, где верхние строки держат 1,7–4,6%, нельзя: там другой звук и другая методика, а сроков выката Canto компания не называла.

Что такое S1-mini и зачем Superwhisper отдала её бесплатно?

S1-mini — модель на 0,6 млрд параметров, дообученная из Qwen3-0.6B, которая не распознаёт речь, а приводит в порядок уже распознанный текст: убирает слова-паразиты, разрешает самопоправки в пользу того варианта, на котором говорящий остановился, расставляет знаки препинания и заглавные буквы, переводит проговоренные числа, даты, суммы и адреса почты в письменный вид. Управляется тремя независимыми осями — тон от разговорного до формального, проза или списки, обычный текст или письмо. Выложена на Hugging Face под лицензией Apache 2.0 с оговоркой о сохранении имени; квантованная сборка занимает 462 МиБ и запускается на процессоре ноутбука. На собственном тестовом наборе из 7519 английских примеров компания заявляет 94,8% верно предсказанных токенов. Открытые веса здесь не благотворительность: платная услуга остаётся в облачных S1-Voice и S1-Language, а бесплатная малая модель работает витриной подхода.

Стал ли голосовой ввод точнее на русском после этих релизов?

Проверяемых оснований так считать нет. Wispr публикует прирост Canto без разбивки по языкам, а пример переключения языков в её материалах — смесь английского с хинди. Superwhisper прямо пишет, что S1-mini в первой версии поддерживает только английский; про семейство S1 в целом компания заявляет работу со смешанной речью, но из наборов для замера S1-Voice по имени назван только англоязычный LibriSpeech. Независимый индекс AA-WER считается на английской речи. То есть отдельных замеров на русском не опубликовано ни по одной из августовских новинок, и утверждение «стало точнее по-русски» сегодня было бы экстраполяцией.

Почему Wispr выпустила новую модель именно сейчас?

Раунд и модель показали в один день, и это выглядит связанным. В обзорах и отзывах последних месяцев повторяется одна жалоба: у части платных пользователей качество диктовки со временем просело. Один из них, надиктовавший больше 350 тысяч слов с начала 2026 года, отдельно отмечает, что дело не в микрофоне — он пишет на студийный, а не на наушники. Претензия при этом не всеобщая: другие постоянные пользователи спада не замечают, то есть проблема, похоже, зависит от условий — языка, нагрузки, набора включённых функций. Собственная модель — прямой ответ на такую претензию: пока распознавание арендуется у стороннего поставщика, влиять на его поведение можно ограниченно.

Что означает уход Wispr «за пределы диктовки»?

Компания описывает движение к системам, которые понимают не только произнесённые слова, но и намерение говорящего. Практически это видно по продуктам: вышел Notetaker для расшифровки встреч с итогами и списком задач, появились партнёрства с производителями носимых устройств, включая кольцо Oasis для диктовки без рук, а 24 июля 2026 открылось исследовательское подразделение Wispr Advanced Interfaces Lab во главе с Арией Растроу, участником команды, создавшей Alexa. Русские пересказы новости выходили под заголовками про замену клавиатуры, но в первоисточнике речь о другом: диктовка становится для компании не конечным продуктом, а входной точкой в более широкий голосовой интерфейс.