Диктуй

chatgpt ∙ openai

GPT-Live на русском и из России: голосовой ChatGPT 2026

8 июля OpenAI выпустила GPT-Live: ChatGPT слушает и говорит одновременно. Разбираю замеры 2026 года, как звучит русский и почему он не заменит диктовку.

9 минут чтенияавтор Михаил Воинский, основатель Диктуй
Коротко

8 июля 2026 OpenAI выпустила голосовые модели GPT-Live и раскатывает их в ChatGPT на iOS, Android и в вебе. Отличие — полный дуплекс: модель слушает и говорит одновременно, её можно перебивать, а тяжёлые вопросы она передаёт текстовой модели в фоне. GPT-Live-1 идёт подпискам Go, Plus и Pro, mini — бесплатным аккаунтам. На старте нет API, видео, демонстрации экрана и памяти в реальном времени, а русская речь, по первым отзывам, звучит роботизированнее английской. Главная граница: GPT-Live — это разговор, а не диктовка текста в рабочие приложения; для второго нужна системная диктовка.

OpenAI считает голос и диктовку одной цифрой: более 150 миллионов человек в неделю пользуются в ChatGPT либо голосовым режимом, либо диктовкой. Цифра красивая, но внутри неё лежат два совершенно разных продукта, и релиз GPT-Live 8 июля 2026 года улучшил ровно один из них. Разобраться, какой именно, стоит до того, как менять свои рабочие привычки — потому что русскоязычная выдача сейчас состоит из пересказов анонса, а практического разбора «что это меняет лично у меня» в ней нет.

Я тут заинтересованное лицо и говорю об этом сразу: делаю Диктуй — голосовой ввод для Windows и macOS. Соблазн натянуть на любой голосовой релиз вывод «а вот у нас лучше» большой, поэтому дальше я держусь официальных замеров OpenAI и первых отзывов, а свой продукт трогаю в одном разделе — там, где речь пойдёт о задачах, которые GPT-Live не закрывает по устройству, а не по качеству.

Что именно выпустила OpenAI

8 июля OpenAI показала семейство голосовых моделей GPT-Live и начала раскатывать его глобально — в приложениях ChatGPT для iOS и Android и в веб-версии. Версии две: GPT-Live-1 для платных подписок Go, Plus и Pro и GPT-Live-1 mini для бесплатных аккаунтов. По данным TechCrunch, mini со временем займёт место нынешнего Advanced Voice Mode как режима по умолчанию. О самом релизе и глобальной раскатке в тот же день сообщила CNBC.

Ключевое слово релиза — полный дуплекс. Прежний голосовой ассистент был устроен каскадом: речь распознавалась в текст, текст обрабатывался, ответ синтезировался обратно в звук. Модель должна была сначала решить, что вы закончили говорить, и только потом начинала отвечать. Отсюда знакомые всем болячки: пауза на середине мысли — и вас перебивают; шум в кафе — и ассистент отвечает на пустоту.

GPT-Live слушает и говорит одновременно и принимает решение много раз в секунду: продолжать слушать, вставить короткое «угу», ответить, помолчать или вызвать инструмент. Если вы задумались, модель не бросается заполнять паузу.

Схема: каскадная архитектура голосового режима против полнодуплексной архитектуры GPT-Live

Второй архитектурный ход — разделение разговора и мышления. GPT-Live отвечает за темп и естественность беседы, а когда вопрос требует поиска, глубоких рассуждений или сложной работы, он передаёт задачу мощной текстовой модели в фоне — по описанию OpenAI на старте это GPT-5.5 — и продолжает разговаривать, пока та считает. Готовый результат вплетается в диалог, когда будет готов. У ответов есть три ступени глубины: Instant, Medium и High.

Заодно OpenAI переписала все девять голосов ChatGPT и добавила визуальные ответы: погоду, курсы, спортивную статистику и карты модель показывает картинкой, а не зачитывает вслух.

Что с русским языком и доступом из России

OpenAI прямо предупреждает, что оптимизировала модель под самые популярные языки ChatGPT и что в отдельных языках возможен неродной акцент и провалы в беглости. Насколько это касается русского, показывают первые отзывы: редактор Т—Ж, протестировавший GPT-Live на платной подписке, отметил, что русская речь всё ещё звучит немного роботизированно. На публичной демонстрации перевода на хинди журналисты TechCrunch услышали тяжёлый американский акцент и книжные обороты. Сама OpenAI пишет об этом обобщённо — что работает над качеством в разных языках, — про русский отдельно не высказывается. По имеющимся отзывам по-русски GPT-Live говорит заметно хуже, чем по-английски.

С доступом ситуация ровно та же, что у остальных продуктов OpenAI: российской картой подписку не оплатить, ни МИР, ни СБП не принимаются. Платные планы Go, Plus и Pro открываются через посредников — сервисы оплаты подписок и виртуальные карты, пополняемые через СБП, наценка у них обычно 5–15%. Это про подписку; если вам нужен не чат, а доступ к моделям OpenAI по API, работает другая схема — рублёвые агрегаторы с наценкой порядка 10–25%, разобранные отдельно. Сам голосовой режим у тестировавших из России при этом работает. Параллельно у русскоязычного пользователя есть Алиса AI с её голосовыми сценариями, YandexGPT и GigaChat — они доступны напрямую и без посредников.

Цифры замеров: где прирост настоящий

По официальным замерам OpenAI, в разговорах длиной 5–10 минут общая предпочтительность GPT-Live-1 против прежнего Advanced Voice Mode составила 75,7%, а плавность беседы оценили в 4,96 балла из 7 против 3,80 у Advanced Voice Mode. На экспертном научном тесте GPQA модель в режиме высоких рассуждений дала 84,2% точности против 45,3% у предыдущего режима. На тесте сложного веб-поиска BrowseComp разрыв ещё резче: 0,7% у Advanced Voice Mode против 75,2% у GPT-Live-1 — из «не работает вообще» в «можно поручить дело».

Здесь стоит притормозить. Прирост на GPQA и BrowseComp — это в первую очередь заслуга той самой фоновой модели, которой GPT-Live передаёт тяжёлые запросы, а не скачок качества самого голосового слоя. Голосовая часть отвечает за плавность и темп — и вот там собственный прирост виден по оценке беседы: 4,96 против 3,80. Разводить эти две вещи полезно, потому что от них зависят разные ожидания: разговор стал приятнее, а «умнее» он стал ровно настолько, насколько умна модель, стоящая за ним.

Первые пользователи, кстати, нашли у естественности обратную сторону. В отзывах после запуска зазвучали жалобы на «переусердствовавшего» ассистента: те самые короткие «угу» и «понял», которые должны были сделать разговор живым, у части людей превратились в новый способ отвлекать. Логика тут простая: звук вторгается во внимание напрямую, и когда собеседник поддакивает слишком старательно, это считывается не как ум, а как навязчивость.

Чего GPT-Live не умеет на старте

Список короче, чем список нового, но он важен для планирования.

  • Нет API. GPT-Live вышел только в приложениях ChatGPT. OpenAI объявила, что приведёт обе модели в API, и открыла форму для уведомления разработчиков, но сроков не назвала. Для голосовых функций в собственном продукте пока остаются модели семейства Realtime — их разбор с ценами и способами доступа из РФ я делал отдельно.
  • Нет видеозвонков и демонстрации экрана. Тем, кому нужно показать модели картинку с камеры или экран, придётся возвращаться к старым голосовым режимам.
  • Нет памяти в реальном времени. GPT-Live не обращается к памяти ChatGPT во время разговора, то есть не подтягивает то, что вы рассказывали о себе раньше.

Отдельно отмечу, что старые Standard и Advanced Voice Mode никуда не делись — они остаются доступны как раз под эти сценарии.

Три разных голоса в ChatGPT — и их постоянно путают

Вот место, где ломается больше всего ожиданий, и релиз GPT-Live сделал путаницу заметнее. Внутри ChatGPT живут три разные голосовые сущности, и они решают разные задачи.

Кнопка микрофона в поле ввода — это диктовка. Вы наговариваете, речь превращается в текст сообщения, вы его видите, правите и отправляете. На выходе — текст.

Голосовой режим — это разговор. Ассистент отвечает вслух, вы отвечаете вслух ему. На выходе — реплики. GPT-Live обновил именно этот сценарий и на кнопку диктовки не влияет вообще.

Системная диктовка — это ввод в любое приложение. Она живёт не в ChatGPT, а в операционной системе: горячая клавиша, речь, и распознанный текст появляется прямо в активном окне — в письме, документе, поле задачи, чате. К ChatGPT она отношения не имеет и работает там же, где вы работаете.

Схема трёх голосовых сценариев: диктовка в поле ввода, голосовой разговор, системная диктовка в любое приложение

Та же развилка в виде таблицы — вместе с прежним голосовым режимом, который никуда не делся:

СпособЧто на выходеГде работаетНужна ли платная подпискаРусский язык
Кнопка микрофона в поле вводатекст сообщения, который вы правитетолько в ChatGPTнетраспознаёт
Advanced Voice Mode (прежний)реплики вслух, по очередитолько в ChatGPTбесплатно с лимитомговорит, качество ниже английского
GPT-Liveреплики вслух, дуплексом, можно перебиватьтолько в ChatGPTGPT-Live-1 — да, mini — нетговорит, по отзывам роботизированнее английского
Системная диктовкатекст прямо в активном окнев любой программе на компьютерезависит от инструментазависит от модели распознавания

Из этой развилки следует практический вывод, который в пересказах анонса теряется: 150 миллионов пользователей в неделю — это сумма двух разных привычек, и улучшение разговора не улучшает диктовку ни на йоту. Человек, который наговаривает в ChatGPT длинные вводные, чтобы получить текст, от GPT-Live не получил ничего нового. Человек, который гуляет и обсуждает с ассистентом идею вслух, получил заметно более живого собеседника.

Где разговор выигрывает, а где нужен текст

Разговор с ассистентом хорош ровно там, где ценность — в самом процессе: продумать идею вслух на прогулке, разобраться в незнакомой теме вопросами, отрепетировать сложный диалог, скоротать дорогу за разбором задачи. В OpenAI на этот сценарий прямо и целятся: руководитель продукта рассказывал, что сам регулярно общается с ассистентом по 30–40 минут во время прогулок — долгие сессии без рук и есть цель релиза.

Но огромная часть работы заканчивается не пониманием, а артефактом: письмом, техническим заданием, постом, задачей в трекере, ответом клиенту. Разговор такого артефакта не оставляет — после него остаются реплики, которые ещё надо превратить в текст. И вот здесь голос по-прежнему помогает, только другим способом: не как беседа, а как ввод.

Механика простая. Средняя скорость печати — около 40 слов в минуту, устная речь идёт на 130–150, и на длинном вводном тексте эта разница превращается в реальные минуты. Встроенные Win+H в Windows и Apple Dictation делают это бесплатно, но заметно спотыкаются, когда в русскую речь вкраплены английские термины — deploy, endpoint, названия библиотек. Полная карта способов перевести речь в текст, включая бесплатные, разобрана отдельно.

Мой Диктуй закрывает как раз эту нишу: горячая клавиша, речь, текст появляется в активном окне — в Word, браузере, мессенджере, поле промпта того же ChatGPT. Есть режим трансформации: наговорил мысль сумбурным потоком, выделил, голосом дал инструкцию «оформи как структурированное ТЗ, детали сохрани» — и на выходе причёсанный текст. Честная граница: это облачное решение, звук уходит на распознавание, и если работа требует, чтобы аудио не покидало компьютер, надо смотреть в сторону локальных инструментов. Бесплатный уровень даёт 30 минут без привязки карты — достаточно, чтобы прогнать свою типичную задачу и понять, ваш ли это способ.

Заодно уточню про смежный сюжет: качество ответа рабочего агента упирается в полноту брифа, а не в модель — об этом был разбор ChatGPT Work и Claude Cowork. Длинный бриф удобнее наговорить, чем напечатать, и это работает независимо от того, чей ассистент на той стороне.

Коротко

GPT-Live — серьёзный шаг для голосового разговора с ИИ: полный дуплекс убирает раздражавшую всех очерёдность, модель можно перебивать, она умеет молчать, а тяжёлые задачи уводит в фон. Прирост на разговорных метриках свой собственный, а прирост на научных и поисковых тестах — во многом заслуга фоновой текстовой модели. На старте нет API, видео, демонстрации экрана и памяти в реальном времени, а русская речь звучит слабее английской.

Главное же для практики — не путать слои. GPT-Live улучшил разговор. Диктовка в поле ввода ChatGPT осталась прежней. А системная диктовка, которая вставляет текст в ваши рабочие приложения, живёт вообще в другом месте стека, и её этот релиз не касается. Голос как интерфейс действительно наступает, но наступает он тремя разными дорогами сразу, и выбирать надо ту, что ведёт к вашему результату.


Михаил Воинский — основатель Диктуй. Если GPT-Live уже доехал до вас — расскажите, как он справляется с русским в долгом разговоре и не мешают ли частые «угу»: support@diktuy.ru или @diktuy_help. Когда откроется API, добавлю в эту статью отдельный раздел с ценами и разбором, что из этого применимо в русскоязычных продуктах.

Часто задаваемые вопросы

Что такое GPT-Live простыми словами?

GPT-Live — новое поколение голосовых моделей OpenAI, представленное 8 июля 2026. Прежний голосовой ассистент работал по очереди: вы говорите, он ждёт паузы, потом отвечает. GPT-Live слушает и говорит одновременно и много раз в секунду решает, что делать дальше — продолжать слушать, вставить короткое «угу», ответить, помолчать или вызвать внешний инструмент. Из-за этого разговор ощущается ближе к беседе с человеком, а не к рации. Раскатка идёт глобально в приложениях ChatGPT на iOS, Android и в веб-версии.

Почему у меня нет GPT-Live?

Раскатка идёт волнами, а не всем одномоментно, поэтому у части пользователей новый режим появляется с задержкой. Проверьте три вещи. Первое — обновлено ли приложение ChatGPT до свежей версии из магазина приложений (в вебе достаточно перезагрузить страницу). Второе — какой у вас план: полноценная GPT-Live-1 идёт платным подпискам Go, Plus и Pro, бесплатным аккаунтам достаётся GPT-Live-1 mini. Третье — простой признак, что новый режим уже у вас: ассистента можно перебить посреди фразы, и он замолкает сразу, а не договаривает до конца. Если всех трёх признаков нет, остаётся подождать свою волну раскатки.

Чем GPT-Live отличается от прежнего Advanced Voice Mode?

Архитектурой и тем, кто отвечает на сложный вопрос. Advanced Voice Mode был пошаговым: модель определяла конец вашей фразы и только потом начинала генерировать ответ, из-за чего короткая пауза или шум могли её сбить. GPT-Live работает в полном дуплексе, а тяжёлые запросы — поиск, глубокие рассуждения, сложные операции — незаметно передаёт мощной текстовой модели в фоне (на старте это GPT-5.5) и вплетает готовый результат в разговор. По замерам OpenAI общая предпочтительность GPT-Live-1 против Advanced Voice Mode в разговорах на 5–10 минут — 75,7%, а оценка плавности беседы 4,96 из 7 против 3,80 у Advanced Voice Mode.

Кому доступен GPT-Live и сколько он стоит?

Отдельной платы за GPT-Live нет, он идёт внутри подписки ChatGPT. Владельцы платных планов Go, Plus и Pro получают полноценную GPT-Live-1, бесплатные аккаунты — облегчённую GPT-Live-1 mini. По данным TechCrunch, mini со временем заменит нынешний Advanced Voice Mode как режим по умолчанию. Старые Standard и Advanced Voice Mode пока остаются доступными для сценариев, которые GPT-Live на старте не закрывает.

Работает ли GPT-Live на русском языке?

Работает, но неровно. OpenAI пишет, что оптимизировала модель под самые популярные языки ChatGPT и что в отдельных языках возможен неродной акцент и провалы в беглости. Русскоязычный редактор Т—Ж, тестировавший модель на платной подписке, отметил, что русская речь по-прежнему звучит немного роботизированно. На демонстрации перевода на хинди журналисты TechCrunch услышали тяжёлый американский акцент и книжные формулировки. То есть по-русски GPT-Live говорит, но до качества английской озвучки не дотягивает.

Есть ли GPT-Live в API для разработчиков?

На момент запуска — нет. GPT-Live вышел только в потребительских приложениях ChatGPT. OpenAI объявила, что приведёт GPT-Live-1 и GPT-Live-1 mini в API, и открыла форму для разработчиков и компаний, которые хотят получить уведомление. Пока API не открыт, для голосовых сценариев в собственном продукте остаются прежние модели семейства Realtime — их разбор с ценами и способами доступа из России есть в отдельной статье.

Чего GPT-Live пока не умеет?

На старте в GPT-Live нет голосовых и видеозвонков, демонстрации экрана, а в режиме реального времени он не обращается к памяти ChatGPT — то есть не подтягивает то, что вы рассказывали о себе в прошлых диалогах. Для этих сценариев приходится возвращаться к старым голосовым режимам. Также нет API. OpenAI обещает добавлять недостающее по мере готовности, но конкретных дат не называет.

Чем голосовой режим ChatGPT отличается от кнопки диктовки?

Результатом. Кнопка микрофона в поле ввода — это диктовка: ваша речь превращается в текст сообщения, вы его видите, правите и отправляете. Голосовой режим и GPT-Live — это разговор: ассистент отвечает вслух, и на выходе у вас реплики, а не готовый текст. Третий, отдельный сценарий — системная диктовка: она вставляет распознанный текст в любое активное окно, от Word до поля коммита. GPT-Live улучшил только разговор и на два других сценария не влияет.

Можно ли пользоваться GPT-Live из России?

Прямой оплаты подписки ChatGPT российской картой нет — ни карты МИР, ни СБП не принимаются, поэтому платные планы Go, Plus и Pro открываются через посредников: сервисы оплаты подписок и виртуальные карты, пополняемые через СБП, с наценкой обычно 5–15%. Это касается именно подписки на чат; доступ к моделям OpenAI по API — отдельная схема через рублёвые агрегаторы, там наценка порядка 10–25%. Отзывы тестировавших модель с платной подпиской из России говорят, что сам режим при этом работает. Для русскоязычных задач параллельно доступны Алиса AI, YandexGPT и GigaChat без посредников — у них свои голосовые сценарии внутри ассистента.

Начни пользоваться приложением уже сегодня.

Установи и диктуй прямо сейчас. 30 минут транскрибации в месяц бесплатно — навсегда, без карты.

Интерфейс приложения «Диктуй» — экран «Учётная запись»
Скачать для macOS

macOS 11+ (Apple Silicon)

Загрузить из MS Store

Windows 10/11 (64-bit)

Если Microsoft Store недоступен (корпоративная политика, старая Windows 10 LTSB), можно скачать установщик с GitHub: DiktuySetup.exe

Если Windows Smart Screen покажет «Защита Windows предотвратила запуск...» — нажми «Подробнее», а затем «Выполнить в любом случае».

Mac на процессоре Intel? Diktuy-macOS-x86_64.dmg