голосовой ввод ∙ superwhisper
Голосовой ввод на компьютере: чем диктовать по-русски в 2026
Разбираю, чем диктовать текст на компьютере по-русски в 2026 и что изменил август: $280 млн у Wispr, своя модель Canto и открытые веса у Superwhisper.
Чем диктовать по-русски на компьютере, за август 2026 не изменилось: встроенные Win+H и системная диктовка macOS бесплатны, локальные решения с открытым кодом не отправляют звук в сеть, облачные приложения удобнее и требуют подписки. При этом 17 августа Wispr привлекла $280 млн при оценке $2 млрд и показала свою модель распознавания Canto, а 19 августа Superwhisper выпустила семейство S1. Обе новости про англоязычный продукт: проверяемых цифр по русской речи в них нет.
Новую модель распознавания Wispr показала не на пустом месте. Несколько месяцев подряд в отзывах на её приложение повторялась одна и та же претензия: качество диктовки у части платных пользователей поехало вниз. Один из них, надиктовавший больше 350 тысяч слов с начала года, в пользовательском обзоре за 2026 год отдельно оговаривался, что дело не в микрофоне — он пишет на студийный Elgato Wave 3, а не на наушники. И вот 17 августа 2026 компания объявляет о раунде на $280 млн, а в том же сообщении показывает Canto — первую собственную модель распознавания за всю историю продукта.
Место, с которого я на это смотрю, стоит обозначить до того, как пойдут цифры. Wispr делает ровно то же, что делаю я, только для другого рынка: у меня Диктуй — голосовой ввод на компьютере с рублёвой оплатой и русским интерфейсом. Хвалить чужой раунд мне незачем, а ругать его — тем более подозрительно, поэтому по фактам держусь блогов обеих компаний, TechCrunch и открытых карточек моделей, а собственный продукт трогаю в одном разделе.
Что произошло за четыре дня августа?
17 августа Wispr объявила о раунде Series B на $280 млн при оценке $2 млрд под ведением Menlo Ventures; всего компания привлекла $361 млн. Со-основатель и генеральный директор Танай Котхари приводит там два показателя масштаба: через Flow надиктовано более 60 млрд слов, продукт используют свыше 10 тысяч компаний. Тогда же показано превью Canto. Через два дня Superwhisper выпустила семейство S1 сразу из трёх моделей.
Общее в этих двух новостях важнее, чем каждая по отдельности. Оба продукта до сих пор строились в основном на чужих моделях распознавания, и оба за одну неделю показали свои. Фундамент, на котором четыре года стояла вся ниша, перестал быть общим.
Три цифры точности, которые нельзя ставить рядом
Из августовских сообщений разошлись три числа, и в пересказах они встали в один ряд, хотя сравнивать их нельзя ни в какой паре.
Canto: «с 30% до 5–10%». Цифра описывает поведение на тяжёлом звуке — уличный шум, ветер, сильный акцент. Тридцать процентов ошибок это не «как было вообще», а «как бывает, когда вы диктуете на ветру». Wispr отдельно оценивает эффект в примерно треть диктовок, которые больше не приходится править руками. Замер сделан самой компанией, методика не опубликована.
S1-Voice: «6,8% в среднем». Superwhisper прогнала модель по восьми наборам записей — встречи, звонки инвесторам, спонтанная речь — и получила 6,8% ошибок в словах, назвав это лучшим результатом среди пятнадцати проверенных моделей. На начитанном LibriSpeech та же модель даёт 2,2%. Разброс между двумя числами одной модели наглядно показывает, насколько цифра точности зависит от звука, а не только от модели.
Верхние строки индекса AA-WER: 1,7–4,6%. Лидерборд Artificial Analysis считает около полусотни моделей по единой методике, и потому числа его верхушки выглядят ниже. Ни Canto, ни S1-Voice в него на момент написания не входят: обе новинки заявлены самими компаниями и стороннего замера пока не проходили. Подробный разбор этого индекса с ценами за час аудио я делал в отдельной статье про модели распознавания речи.
Практический вывод из всех трёх: заявление «доля ошибок упала вдвое» без указания, на каком звуке и кем меряли, сегодня не значит почти ничего. Это относится и к цифрам, которые публикую я.
Зачем Superwhisper отдала нормализатор с открытыми весами?
Самая содержательная часть августа — не деньги, а то, как Superwhisper разложила диктовку на слои и один из них выложила наружу.
Диктовка на компьютере состоит из двух разных задач. Первая — распознавание: превратить звук в последовательность слов. Вторая — нормализация: превратить эту последовательность в текст, который не стыдно отправить. Разница между ними заметнее, чем кажется. Расшифровка живой речи выглядит примерно так: «ну то есть нам нужно... нет, не пятнадцать, семнадцать штук к пятнице». Письменный вид того же: «Нам нужно 17 штук к пятнице». Слова распознаны верно в обоих случаях; читаемым текст делает второй слой.
S1-mini закрывает ровно этот второй слой и больше ничего. Речь она не распознаёт и на вопросы не отвечает — принимает готовую расшифровку и переписывает её начисто: убирает паразиты, разрешает самопоправки в пользу того варианта, на котором говорящий остановился, расставляет знаки препинания и заглавные, переводит проговоренные числа, даты, суммы и адреса почты в письменный вид. Управление устроено тремя независимыми осями: тон (от разговорного до формального), структура (проза или списки), назначение (обычный текст или письмо).
Технические параметры: 0,6 млрд параметров, дообучена из Qwen3-0.6B, лицензия Apache 2.0 с оговоркой о сохранении имени модели. Квантованная сборка занимает 462 МиБ и работает на процессоре ноутбука без видеокарты. Заявленная точность — 94,8% верно предсказанных токенов на собственном наборе из 7519 английских примеров.
Открытые веса тут не жест доброй воли. Платная услуга остаётся в облачных S1-Voice и S1-Language, а маленькая бесплатная модель показывает подход и снимает у скептиков вопрос «что там внутри». Русскому пользователю от неё пока пользы мало: первая версия понимает только английский, а специализированной модели такого класса для русского текста я не нашёл — эту работу у нас продолжают делать большие языковые модели общего назначения, дороже и медленнее полугигабайтной.
Что все эти цифры говорят про русский?
Ничего. И это стоит проговорить прямо, потому что новость подавалась как событие для всей отрасли.
Wispr публикует прирост Canto без разбивки по языкам. Пример переключения языков внутри фразы в её материалах — смесь английского с хинди. Superwhisper указывает в карточке модели: S1-mini в первой версии поддерживает только английский. Из наборов, на которых мерили S1-Voice, по имени назван англоязычный LibriSpeech. Индекс AA-WER считается на английской речи.
При этом аудитория у таких продуктов сильно не англоязычная: по собственным данным Wispr, приложение поддерживает больше сотни языков, а доля английского в использовании — около 40%. То есть большинство диктовок в мире идёт не на английском, а все публикуемые цифры точности — про английский. Разрыв между этими двумя фактами и есть то место, где живёт русскоязычный пользователь.
Чем диктовать текст на компьютере на русском в 2026?
Набор рабочих способов за эти четыре дня не изменился, и их по-прежнему три. Ниже — что каждый даёт и где упирается.
Бесплатный голосовой ввод: Win+H и системная диктовка macOS
Он уже установлен. В Windows сочетание Win+H открывает панель голосового ввода в любом текстовом поле; русский включается в языковых параметрах. В macOS то же делает системная диктовка из раздела «Клавиатура» в системных настройках. Ни регистрации, ни подписки, ни установки.
Упирается это в три вещи: знаки препинания на длинных текстах, английские термины внутри русской фразы и полное отсутствие обработки надиктованного — что сказали, то и вставилось. Для сообщения в мессенджер хватает, для статьи или письма клиенту обычно нет. Что Microsoft добавила в диктовку за лето и кому это досталось, разобрано в статье про Fluid Dictation.
Локальное с открытым исходным кодом
Модель крутится на самом компьютере, звук не уходит в сеть вообще. Единственный подходящий вариант там, где запись по закону или внутренней политике не должна покидать машину: врачебная тайна, адвокатская тайна, закрытый контур. Плата за это — разовая установка модели весом от полугигабайта, английский интерфейс у большинства проектов и заметная нагрузка на процессор. Готовые настольные программы такого рода я разбирал в обзоре открытых решений.
Облачные программы и приложения для голосового ввода
Здесь живут Wispr Flow, Superwhisper и Диктуй — мой продукт: горячая клавиша, речь, текст появляется в активном окне, оплата в рублях, интерфейс и поддержка на русском.
Про деньги коротко. Тариф Pro у Wispr Flow — $15 за пользователя в месяц, $12 при годовой оплате; платёж идёт через Stripe, российские карты он не принимает. Подробный разбор способов оплаты из России со всеми комиссиями у меня написан отдельно. Русского интерфейса и рублёвой оплаты не появилось ни у Wispr, ни у Superwhisper, и ни в одном из августовских сообщений про российский рынок нет ни слова.
Про второй слой, о котором шла речь выше, скажу как есть. Своей модели распознавания у меня нет — Диктуй работает на открытой модели Whisper, и августовские новости этого не изменили; почему выбрана именно она, разобрано в отдельном техническом разборе. А слой приведения текста в порядок закрыт Режимом трансформации: выделяешь надиктованный кусок, отдельной клавишей даёшь голосом инструкцию — «убери повторы, оформи деловым письмом» — и модель переписывает. По сути та же задача, что решает S1-Language, только инструкция задаётся голосом, а не тремя переключателями, и работает она на русском.
Честные границы тоже назову. Диктуй облачный: звук уходит на распознавание, и для материалов, которые не должны покидать компьютер, он не подходит — там нужен локальный вариант из предыдущего пункта. Мобильных приложений у меня нет, у Wispr они есть. Собственной модели, как теперь у обеих упомянутых компаний, тоже нет.
Выбирать между тремя слоями по чужим процентам бессмысленно — разброс между ними меньше, чем разброс между вашими условиями записи. Расстояние до микрофона, фон и темп речи дают больший эффект, чем разница между любыми двумя моделями из таблиц выше; с замерами это разобрано в статье про ошибки голосового ввода. Практичнее взять свою типичную задачу и прогнать её на бесплатном уровне: 30 минут диктовки без привязки карты покрывают десяток реальных писем и заметок, после которых видно, экономит голос время или нет.
Насколько на самом деле выросла оценка?
Цифра $2 млрд разошлась по заголовкам без второй половины сравнения. Девятью месяцами раньше, в ноябре 2025 года, Reuters сообщал об оценке компании в $700 млн по итогам предыдущего раунда. Рост почти втрое.
Два понятия в пересказах слипаются. Оценка компании — величина, из которой считается доля инвестора за вложенные деньги, то есть ожидания. Выручка — то, что реально получено от клиентов; абсолютных цифр Wispr не публикует, но раскрыла динамику: рост более чем на 150% в каждом из четырёх последних кварталов. Формулировка «сервис диктовки стоит два миллиарда» описывает первое, а читается как второе.
Означает оценка вот что: инвесторы перестали считать голосовой ввод функцией внутри чужой операционной системы. TechCrunch в разборе раунда перечисляет целую группу конкурентов, за которыми теперь следят: Willow, Monologue, Aqua, Superwhisper, а со стороны расшифровки встреч — Granola, Fireflies, Read AI. Четыре года назад такого списка не существовало.
Почему Wispr уходит от диктовки
Русские пересказы новости вышли под заголовками про замену клавиатуры. Первоисточник говорит о другом: диктовка для компании становится не конечным продуктом, а входной точкой. Вышел Notetaker — расшифровка встреч с итогами и списком задач, то есть выход на поляну Granola и Fireflies. Появились партнёрства с производителями носимых устройств, включая кольцо Oasis для диктовки без рук. Про саму Canto Котхари пишет, что модель — только начало пути к диктовке, которую не приходится править. Та же убеждённость, по его словам, стоит и за исследовательским подразделением Wispr Advanced Interfaces Lab, которое компания открыла 24 июля 2026 во главе с Арией Растроу, участником команды, создавшей Alexa. Цель там сформулирована как системы, которые понимают не произнесённые слова, а намерение.
Для пользователя, которому нужно просто надиктовать письмо, это скорее предупреждение: продукт, который берёт деньги за диктовку, направляет новые $280 млн в соседние задачи. Хорошая новость в том, что в нише остаются те, для кого диктовка и есть продукт.
Коротко
Голосовой ввод за неделю августа перестал быть надстройкой над чужими моделями. Wispr привлекла $280 млн при оценке $2 млрд — почти втрое выше ноябрьской — и показала первую собственную модель распознавания Canto, ответив ею на месяцами копившиеся претензии к качеству. Superwhisper двумя днями позже выпустила своё семейство S1 и выложила нормализатор текста с открытыми весами, разделив диктовку на два честно названных слоя.
Русскому языку из этого не досталось ни одной проверяемой цифры: замеры Canto без разбивки по языкам, S1-mini в первой версии только английский, индекс AA-WER на английской речи. Оценка в два миллиарда описывает ожидания инвесторов от англоязычного продукта, а способов надиктовать русский текст на компьютере как было три, так и осталось — встроенный бесплатный, локальный открытый, облачный с подпиской.
«Если пользуетесь Flow или Superwhisper на русском — интересно ровно одно: заметили ли вы разницу после августовских обновлений на своих записях. Пишите на support@diktuy.ru или в @diktuy_help. Появятся замеры Canto или S1-Voice на русской речи — добавлю их сюда отдельным разделом.»— Михаил Воинский, основатель «Диктуй»
Часто задаваемые вопросы
Чем диктовать текст на компьютере на русском в 2026?
Рабочих слоёв три. Встроенное и бесплатное: Win+H в Windows и системная диктовка в macOS, обе понимают русский, обе заметно проседают на технической лексике и переключении между языками внутри фразы. Локальное с открытым исходным кодом: модель крутится прямо на компьютере, звук никуда не уходит — единственный подходящий вариант, когда запись по закону или внутренней политике не должна покидать машину. Облачные приложения: удобнее остальных, распознают точнее, требуют подписки и интернета; здесь есть и зарубежные с оплатой в валюте, и российские с рублёвой оплатой. Августовские релизы Wispr и Superwhisper этот набор не изменили — обе новинки живут в англоязычном контуре.
Есть ли бесплатный голосовой ввод на компьютере?
Да, и он уже установлен. В Windows сочетание Win+H открывает панель голосового ввода в любом текстовом поле, русский поддерживается и включается в языковых параметрах. В macOS то же самое делает системная диктовка, включается в разделе «Клавиатура» системных настроек. Оба варианта бесплатны, не требуют регистрации и покрывают короткие сообщения и заметки. Ограничения проявляются на длинных текстах и профессиональной лексике: встроенные средства хуже расставляют знаки препинания, спотыкаются на английских терминах внутри русской фразы и не умеют переписывать надиктованное. У платных приложений тоже почти всегда есть бесплатный уровень — например, Wispr Flow даёт 2000 слов в неделю на компьютере.
Какая программа для голосового ввода лучше на русском?
Единого ответа нет: три класса программ решают разные задачи. Для коротких сообщений и заметок лучшая программа та, что уже стоит, — Win+H или системная диктовка macOS, платить не за что. Для конфиденциальных записей нужно приложение с локальной моделью, где звук не покидает компьютер, даже ценой английского интерфейса и нагрузки на процессор. Для ежедневной работы с длинными текстами удобнее облачное приложение: точнее распознавание, обработка надиктованного, словарь терминов. Выбирать между ними по чужим процентам точности бессмысленно — разброс между условиями вашей записи больше, чем между самими программами. Практичнее прогнать одну свою типичную задачу на бесплатном уровне каждого варианта и сравнить результат.
Что произошло с голосовым вводом в августе 2026?
Два события за четыре дня. 17 августа Wispr, разработчик приложения Flow, объявила о раунде Series B на $280 млн при оценке $2 млрд и показала превью собственной модели распознавания Canto. 19 августа Superwhisper выпустила семейство моделей S1: облачное распознавание S1-Voice, облачную модель обработки текста S1-Language и локальный нормализатор S1-mini, выложенный с открытыми весами на Hugging Face. Обе компании делают приложения для голосового ввода на компьютере, и обе до этого опирались в основном на чужие модели распознавания.
Значит ли оценка в $2 млрд, что рынок голосового ввода стоит два миллиарда?
Нет, это две разные величины. $2 млрд — оценка одной компании, Wispr, по итогам сделки с инвесторами: сумма, из которой считается доля за вложенные деньги. Ни выручкой, ни размером рынка она не является. Абсолютных цифр выручки Wispr не публикует, но вместе с раундом раскрыла её динамику: рост более чем на 150% в каждом из четырёх последних кварталов. Про рынок диктовки в целом оценка говорит одно: инвесторы считают направление достаточно большим, чтобы платить за долю в нём почти втрое дороже, чем девять месяцев назад.
Что такое Canto и насколько она точнее прежних моделей?
Canto — первая собственная модель распознавания речи Wispr, показанная в превью 17 августа 2026. Компания заявляет, что на тяжёлом звуке — уличный шум, ветер, сильный акцент — доля ошибок в словах падает с 30% и выше до 5–10%, а число диктовок, которые приходится править руками, сокращается примерно на треть. Модель заявлена как умеющая переключение между языками внутри фразы, пользовательские словари и распознавание имён из адресной книги. Важная оговорка: цифра описывает поведение в сложных условиях, а не общую точность. Ставить её рядом с рейтингами вроде AA-WER, где верхние строки держат 1,7–4,6%, нельзя: там другой звук и другая методика, а сроков выката Canto компания не называла.
Что такое S1-mini и зачем Superwhisper отдала её бесплатно?
S1-mini — модель на 0,6 млрд параметров, дообученная из Qwen3-0.6B, которая не распознаёт речь, а приводит в порядок уже распознанный текст: убирает слова-паразиты, разрешает самопоправки в пользу того варианта, на котором говорящий остановился, расставляет знаки препинания и заглавные буквы, переводит проговоренные числа, даты, суммы и адреса почты в письменный вид. Управляется тремя независимыми осями — тон от разговорного до формального, проза или списки, обычный текст или письмо. Выложена на Hugging Face под лицензией Apache 2.0 с оговоркой о сохранении имени; квантованная сборка занимает 462 МиБ и запускается на процессоре ноутбука. На собственном тестовом наборе из 7519 английских примеров компания заявляет 94,8% верно предсказанных токенов. Открытые веса здесь не благотворительность: платная услуга остаётся в облачных S1-Voice и S1-Language, а бесплатная малая модель работает витриной подхода.
Стал ли голосовой ввод точнее на русском после этих релизов?
Проверяемых оснований так считать нет. Wispr публикует прирост Canto без разбивки по языкам, а пример переключения языков в её материалах — смесь английского с хинди. Superwhisper прямо пишет, что S1-mini в первой версии поддерживает только английский; про семейство S1 в целом компания заявляет работу со смешанной речью, но из наборов для замера S1-Voice по имени назван только англоязычный LibriSpeech. Независимый индекс AA-WER считается на английской речи. То есть отдельных замеров на русском не опубликовано ни по одной из августовских новинок, и утверждение «стало точнее по-русски» сегодня было бы экстраполяцией.
Почему Wispr выпустила новую модель именно сейчас?
Раунд и модель показали в один день, и это выглядит связанным. В обзорах и отзывах последних месяцев повторяется одна жалоба: у части платных пользователей качество диктовки со временем просело. Один из них, надиктовавший больше 350 тысяч слов с начала 2026 года, отдельно отмечает, что дело не в микрофоне — он пишет на студийный, а не на наушники. Претензия при этом не всеобщая: другие постоянные пользователи спада не замечают, то есть проблема, похоже, зависит от условий — языка, нагрузки, набора включённых функций. Собственная модель — прямой ответ на такую претензию: пока распознавание арендуется у стороннего поставщика, влиять на его поведение можно ограниченно.
Что означает уход Wispr «за пределы диктовки»?
Компания описывает движение к системам, которые понимают не только произнесённые слова, но и намерение говорящего. Практически это видно по продуктам: вышел Notetaker для расшифровки встреч с итогами и списком задач, появились партнёрства с производителями носимых устройств, включая кольцо Oasis для диктовки без рук, а 24 июля 2026 открылось исследовательское подразделение Wispr Advanced Interfaces Lab во главе с Арией Растроу, участником команды, создавшей Alexa. Русские пересказы новости выходили под заголовками про замену клавиатуры, но в первоисточнике речь о другом: диктовка становится для компании не конечным продуктом, а входной точкой в более широкий голосовой интерфейс.