Готовит ли OpenAI новую революцию в IT?

от автора

Некоторое время назад появилась новость, что Сэм Альтман и Джонни Айв начали совместный проект. Тогда практически ничего не сообщалось о том, что именно они собираются делать. Говорилось лишь о том, что речь идет не о программном обеспечении, а о каком-то новом устройстве.

И вот недавно появились подробности, что этим устройством станет нечто вроде умной колонки. Честно говоря, сначала это разочаровало. Рынок умных колонок уже давно существует. Есть Amazon Echo, Apple HomePod, Яндекс Алиса и др. Казалось бы, зачем делать еще одну? В этом инсайде есть и еще одна деталь, а именно: устройство будет ориентировано прежде всего на голосовое взаимодействие. Но здесь снова возникает вопрос — а в чем собственно новизна? Ведь все умные колонки и так управляются голосом.

Но тут же, параллельно, OpenAI выпускает Voice Mode в ChatGPT. Причем, это уже не просто диктовка текста. Разница между обычной диктовкой и Voice Mode очень даже существенная. При диктовке ты говоришь, заканчиваешь фразу, ждешь распознавания, исправляешь ошибки, отправляешь сообщение. Voice Mode работает гораздо круче. Голосовой ассистент слушает постоянно, реагирует практически мгновенно, без пауз, поддерживая таким образом естественный темп разговора. Может даже говорить одновременно с пользователем. Через пару-тройку фраз перестаешь воспринимать происходящее как работу с программой. Возникает ощущение разговора с человеком.

Кому идти на выход?

Первая волна отзывов о Voice Mode пошла о том, как удобно использовать этот режим в качестве репетитора для изучения иностранного языка. Я тоже попробовал и провалил первый же разговор, потому как ожидал действительно какого-то репетиторства с короткими, медленными и идеально проговариваемыми фразами и не был готов к быстрому и насыщенному диалогу. Но вот другой эксперимент с использованием Voice Mode от ChatGPT в качестве переводчика прошел очень даже удачно. Так что когда нам говорят, что ИИ заменит программистов, то стоит, наверное, посмотреть и в другие стороны. Не знаю как с репетиторами, думаю они еще будут нужны. А вот переводчикам, похоже, пора готовить запасные аэродромы.

И если посмотреть на эти новости вместе и в перспективе, то практически неизбежно приходишь к выводу о том, что OpenAI действительно готовит следующую революцию в ИТ!

А именно: в истории развития вычислительной техники есть важные вехи, связанные с устройствами для ввода информации. Сначала перфокарты, потом клавиатура, затем мышь, и наконец сенсорный экран.

И теперь мы можем предположить, что OpenAI задумала использовать для ввода информации новое устройство — голос человека.

С этой точки зрения создание умной колонки уже не выглядит банальностью, если под такой колонкой понимать не просто девайс, который распознает голосовые команды, а полноценный компьютер, но уже без клавиатуры и без мышки. И главным средством управления этим компьютером станет именно голос человека.

Именно такой поворот, как написал бы ИИ )), кардинально меняет ситуацию.

Об этом может свидетельствовать и следующее интересное наблюдение. Во всех предыдущих случаях пользователю нужно было научиться пользоваться устройством ввода — освоить клавиатуру, мышку, сенсорный экран. А вот в случае с голосом учиться уже будет больше ИИ: распознавать голос человека, понимать о чем он говорит, удерживать в памяти и т.д. Т.е., происходит действительно кардинальная смена пользовательского интерфейса и способов взаимодействия пользователя с компьютером.

Можно пойти еще дальше в этом футуристическом прогнозе. А именно: мы по привычке говорим о голосе как о новом интерфейсе. Но, возможно, что голос — это только первый шаг и что настоящий интерфейс будущего — это естественное человеческое общение.

Предположим, что завтра оно будет происходить голосом. А послезавтра к нему добавятся камера, взгляд, жесты, понимание окружающей обстановки, память о предыдущих разговорах и знание контекста. Компьютер будет воспринимать ситуацию сразу через несколько каналов, также как это делает человек.

Т.е., голос окажется не целью, а первым и самым естественным способом начать этот переход.

Дань уважения Siri

Здесь стоит вспомнить Siri. Сегодня принято над ней посмеиваться. Однако именно Siri первой показала миллионам людей способ разговора с компьютером голосом. Даже во многих фильмах стали показывать очень удобный способ, когда человек голосом дает задание Siri позвонить кому-то из своих контактов. Современные большие языковые модели, конечно, ушли довольно далеко вперед. Они уже понимают смысл сказанного, удерживают контекст разговора, задают уточняющие вопросы и способны поддерживать диалог.

Если эта гипотеза окажется верной, то лет через сколько-то клавиатура может восприниматься примерно так же, как сегодня воспринимается командная строка: хороший инструмент для специалистов, но уже не основной способ общения большинства людей с компьютером.

Из всего сказанного напрашивается вполне практический вывод: следующая большая волна для стартапов — голосовые интерфейсы. И есть реальные основания полагать, что это направление станет самым перспективным в ближайшее время.

ссылка на оригинал статьи https://habr.com/ru/articles/1062852/