Логотип
Как я, ты был, как я, ты будешь (Г. Гимлер).

От vibe coding к vibe doing: как GPT-6 Astra учится выполнять задачи за человека

От vibe coding к vibe doing: как GPT-6 Astra учится выполнять задачи за человека

За последние годы искусственный интеллект постепенно прошёл путь от обычного чат-бота до инструмента, который способен писать программный код, создавать изображения, анализировать документы и помогать пользователю принимать решения. Однако следующий этап развития ИИ может оказаться гораздо интереснее. Речь идёт уже не просто о генерации информации, а о способности искусственного интеллекта самостоятельно пользоваться компьютером и выполнять действия вместо человека.

Именно вокруг этой идеи развивается концепция, которую всё чаще называют vibe doing. Если vibe coding подразумевает создание программ с помощью естественных инструкций, то vibe doing значительно шире: человек описывает желаемый результат, а искусственный интеллект самостоятельно определяет, какие приложения открыть, какие элементы интерфейса нажать, какие данные найти и какие действия выполнить.

В сентябре 2026 года внимание к этому направлению привлёк GPT-6 Astra от OpenAI. В демонстрациях модель показывает работу с компьютерными интерфейсами, а сама концепция напоминает давнюю мечту разработчиков: разговаривать с компьютером на человеческом языке и получать не объяснение, а непосредственно выполненный результат.

 

От эксперимента 1979 года к современному компьютеру

Идея управления компьютером посредством естественной речи появилась задолго до современных нейросетей. В 1979 году исследователи MIT Architecture Machine Group продемонстрировали систему, известную как «Put that there». Пользователь мог указать на экран и голосом попросить компьютер разместить объект в определённом месте.

Сегодня подобный эксперимент кажется очень простым. Однако его значение было огромным: впервые особенно наглядно демонстрировалась идея, согласно которой человеку необязательно изучать специальный язык команд, чтобы объяснить машине своё намерение.

Прошло почти полвека. За это время компьютерные интерфейсы прошли путь от командной строки к графическим оболочкам, мыши, сенсорным экранам и голосовым помощникам. Но принцип оставался примерно одинаковым: человек должен был сам понимать устройство программы и последовательно выполнять необходимые действия.

Современные модели искусственного интеллекта пытаются изменить именно эту часть взаимодействия. Пользователю всё меньше приходится объяснять компьютеру, как выполнить задачу. Вместо этого он формулирует, что нужно получить.

 

Что такое vibe doing

Термин vibe coding стал популярен благодаря инструментам, которые позволяют создавать приложения практически без традиционного программирования. Человек описывает идею обычным языком, а ИИ генерирует код, исправляет ошибки и постепенно доводит проект до рабочего состояния.

Vibe doing идёт на следующий уровень. В данном случае искусственный интеллект не ограничивается созданием программного кода. Он получает возможность самостоятельно работать с уже существующими приложениями.

Например, пользователю не обязательно объяснять, где находится нужная таблица, как открыть электронную почту или в каком разделе CRM находится карточка клиента. Теоретически достаточно сказать: «Найди данные о продажах за последний квартал, сравни их с предыдущим периодом и подготовь отчёт».

После этого агент должен самостоятельно определить последовательность действий. Он может открыть файловый менеджер, найти нужный документ, запустить электронную таблицу, обработать данные, сформировать график и сохранить результат.

Таким образом, компьютер превращается из набора отдельных приложений в единую среду, которой можно управлять посредством намерений пользователя.

 

Почему управление интерфейсом так важно

На первый взгляд может показаться, что подобная возможность не является революционной. Ведь современные сервисы давно предоставляют API, через которые одна программа может взаимодействовать с другой. Однако API есть далеко не у каждого приложения.

Особенно сложная ситуация складывается со старыми корпоративными программами, специализированным программным обеспечением и сайтами, которые изначально создавались исключительно для людей.

Если программа не имеет API, автоматизация обычно требует отдельной интеграции. Разработчикам приходится создавать специальный коннектор, изучать внутреннюю структуру системы и поддерживать его работоспособность после обновлений.

Читать  "Как это делается?": в крупных международных банках юниоры учат своих боссов пользоваться ИИ

Computer use предлагает совершенно другой подход. Если человек способен открыть приложение, увидеть кнопку на экране, переместить указатель мыши и ввести текст с клавиатуры, то достаточно развитый ИИ теоретически может повторить эти действия.

В результате графический интерфейс становится своеобразным универсальным уровнем взаимодействия. Машине необязательно знать внутреннюю архитектуру программы: она может взаимодействовать с ней примерно так же, как это делает человек.

 

Что GPT-6 Astra демонстрирует на практике

В демонстрациях OpenAI GPT-6 Astra показан как модель, способная работать непосредственно с компьютерной средой. В одном из сценариев первоначально простой объект на экране постепенно превращается в основу более сложного проекта. В других примерах модель помогает создавать презентацию, взаимодействовать с документами и выполнять различные действия на компьютере.

Особенно важен сам принцип работы. Пользователь не обязан давать модели инструкцию в формате пошагового руководства. Он формулирует конечную цель, после чего ИИ пытается самостоятельно определить последовательность операций.

Такой подход может быть полезен в самых разных сферах:

  • заполнение онлайн-форм и перенос данных между системами;
  • работа с электронными таблицами и подготовка отчётов;
  • обновление информации в CRM;
  • организация календаря и рабочих задач;
  • поиск файлов и обработка документов;
  • подготовка презентаций и других офисных материалов;
  • работа со старыми программами, у которых нет современных API.

 

Почему результаты тестов заслуживают внимания

Возможности компьютерного управления особенно хорошо видны в специализированных тестах. В публикации Xataka приводится результат GPT-6 Astra в OSWorld 2.0 — тесте, который оценивает способность искусственного интеллекта самостоятельно работать с компьютерной средой. Astra показывает результат 72,6%, тогда как у приведённых для сравнения GPT-5.6 Sol показатель составлял 65,7%, а у Claude Opus 5 — 70,2%.

Ещё один показатель касается ScreenSpot-Pro — теста, оценивающего способность модели правильно находить элементы графического интерфейса. Для Astra приводится результат 92,7%.

При этом одними красивыми цифрами ограничиваться нельзя. Результат 72,6% означает и обратную сторону: в значительной доле задач система всё ещё ошибается. Для обычного эксперимента это допустимо, но для финансовых операций, юридических документов, корпоративных баз данных или управления критической инфраструктурой такая вероятность ошибки может быть слишком высокой.

Именно поэтому способность выполнять действие важнее одного лишь умения правильно ответить на вопрос. Ошибка чат-бота в тексте может потребовать простой корректировки. Ошибка автономного агента может привести к изменению файла, отправке сообщения, покупке товара или удалению информации.

 

Vibe doing отличается от обычного чат-бота

Обычный чат-бот в основном является интеллектуальным собеседником. Он получает запрос, анализирует его и формирует ответ. Даже если ответ содержит подробную инструкцию, конечные действия выполняет человек.

Агент с возможностью computer use работает иначе. Его задача состоит не только в создании текста, но и в последовательном выполнении операций.

Упрощённо разницу можно представить следующим образом:

  • чат-бот объясняет, что нужно сделать;
  • vibe coding создаёт код по описанию задачи;
  • vibe doing пытается самостоятельно выполнить задачу в цифровой среде.

 

Именно последний вариант потенциально способен изменить повседневную работу с компьютером. Пользователю становится не так важно, знает ли он конкретную программу. Значительно важнее правильно сформулировать конечный результат.

 

Компьютер может стать универсальным инструментом для ИИ

Сегодня человек вынужден адаптироваться к логике каждого приложения. Для работы с графическим редактором нужно знать его инструменты, для электронной таблицы — формулы и функции, для CRM — структуру карточек и меню, для системы документооборота — собственные правила навигации.

Если ИИ научится достаточно надёжно работать с графическими интерфейсами, эта необходимость может постепенно уменьшиться.

Пользователь сможет говорить не «открой такую-то программу, перейди в раздел, выбери фильтр, установи период и экспортируй данные», а просто сформулировать конечную цель: «Подготовь отчёт по продажам за август и сравни его с июлем».

Модель сама будет решать, какие действия необходимы для достижения результата.

Это потенциально меняет саму философию пользовательского интерфейса. Сейчас интерфейс является средством, через которое человек управляет программой. В будущем он может стать промежуточным уровнем, который ИИ использует вместо человека.

Читать  Claude Mythos: слишком мощный ИИ, который решили скрыть от публики

 

Главная проблема — ошибки и контроль

Несмотря на впечатляющие демонстрации, говорить о полном отказе от мыши и клавиатуры пока преждевременно. Даже высокая точность не означает абсолютной надёжности.

Главная проблема автономного агента заключается в том, что он не просто генерирует ошибочную информацию, а способен совершать реальные действия. Если модель неправильно поняла задачу, последствия могут быть значительно серьёзнее обычной галлюцинации чат-бота.

Особенно осторожно следует относиться к операциям, связанным с деньгами, персональными данными, юридическими документами, удалением файлов, публикацией информации и изменением корпоративных систем.

Поэтому наиболее реалистичный сценарий ближайшего будущего — не полная автономность, а система с несколькими уровнями подтверждения. ИИ сможет самостоятельно выполнять безопасные действия, но перед критическими операциями будет запрашивать разрешение человека.

 

Безопасность становится важнее, чем раньше

Чем больше полномочий получает искусственный интеллект, тем выше потенциальная цена его ошибки или злоупотребления. Если агент имеет доступ к браузеру, электронной почте, файлам и рабочим приложениям, он фактически получает возможность воздействовать на цифровую среду пользователя.

Дополнительную проблему создают вредоносные инструкции, которые могут находиться внутри веб-страниц или документов. Агенту приходится отличать команды пользователя от содержимого, которое он просто видит на экране.

В материалах о GPT-6 Astra отдельно обращается внимание и на результаты тестов, связанных с кибербезопасностью. Высокие показатели подобных моделей показывают не только полезные возможности, но и необходимость строгого контроля за тем, какие действия разрешены агенту.

Поэтому развитие computer use неизбежно будет связано с механизмами разрешений, изоляцией среды, журналированием действий и возможностью быстро остановить выполнение задачи.

 

Что будет с мышью и клавиатурой

Парадокс новой технологии заключается в том, что мы десятилетиями совершенствовали интерфейсы именно для людей. Создавались окна, меню, кнопки, папки, значки, сенсорные экраны и другие элементы, призванные сделать компьютер понятнее.

Теперь искусственный интеллект учится пользоваться всеми этими элементами вместо нас.

При этом мышь и клавиатура вряд ли исчезнут мгновенно. Для точных профессиональных операций они останутся удобнее голосовой команды. Дизайнеру может быть проще самостоятельно отрегулировать объект, разработчику — написать небольшую команду в терминале, а опытному пользователю — быстро выполнить привычную последовательность действий.

Скорее всего, произойдёт разделение задач. Человек будет формулировать цели и контролировать результат, а ИИ — выполнять длинные и рутинные последовательности действий.

 

Как изменится работа специалистов

Распространение vibe doing может заметно изменить требования к цифровым навыкам. Сейчас сотруднику часто приходится изучать конкретное программное обеспечение. В будущем часть этих знаний может заменить способность правильно ставить задачи искусственному интеллекту.

Это не означает, что профессиональные навыки станут ненужными. Напротив, чем больше задач передаётся агенту, тем важнее становится способность оценивать полученный результат.

Например, ИИ может самостоятельно подготовить финансовую таблицу, но специалист должен понимать, насколько корректны исходные данные и формулы. Агент способен составить юридический документ, но ответственность за его применение не обязательно исчезает вместе с автоматизацией.

Поэтому можно ожидать смещения акцента от механического выполнения операций к постановке задач, проверке результатов и управлению автоматизированными процессами.

 

Почему это может стать следующим этапом развития ИИ

До появления современных генеративных моделей компьютеры были очень точными, но не обладали гибкостью человеческого общения. ИИ изменил ситуацию: теперь машина способна понимать естественный язык, но долгое время ей не хватало возможности непосредственно воздействовать на окружающую цифровую среду.

Computer use соединяет эти две способности. Модель получает инструкцию на естественном языке, анализирует интерфейс, планирует последовательность действий и взаимодействует с приложениями.

Именно поэтому vibe doing выглядит более значимым направлением, чем просто очередной способ автоматизации офисных задач. Оно потенциально превращает ИИ из советчика в исполнителя.

Пока эта трансформация находится на ранней стадии. Даже показатель более 70% успешных действий в специализированном тесте нельзя воспринимать как гарантию надёжности. Но направление развития уже очевидно: всё больше задач будут передаваться агентам, способным не только отвечать, но и действовать.

 

Перспективы технологии

В ближайшие годы можно ожидать появления всё большего числа приложений, где пользователь практически не взаимодействует с традиционным интерфейсом напрямую. Вместо десятков кнопок и меню он будет формулировать цель обычной фразой.

Читать  Утечка исходного кода Claude Code: что произошло и почему это подарок конкурентам

Наиболее перспективными могут оказаться задачи, которые сегодня требуют большого количества повторяющихся действий: обработка документов, перенос данных, составление отчётов, организация информации, заполнение форм и взаимодействие с несколькими сервисами одновременно.

При этом полностью автономный компьютер вряд ли появится одномоментно. Скорее всего, развитие будет идти поэтапно: сначала ИИ будет выполнять отдельные операции, затем — цепочки действий, а после этого сможет самостоятельно планировать достаточно сложные рабочие процессы.

В конечном итоге компьютер может стать для человека примерно тем же, чем стал поисковик после появления интернета. Пользователю будет всё меньше важно знать внутреннюю структуру системы. Главное — понимать, какой результат ему нужен.

 

Выводы

GPT-6 Astra и концепция vibe doing показывают возможное направление дальнейшего развития искусственного интеллекта. Речь идёт уже не просто о создании текста, кода или изображений, а о непосредственном выполнении задач в цифровой среде.

Главная идея заключается в переходе от инструкции к намерению. Человеку не обязательно описывать каждый шаг — он сообщает конечную цель, а ИИ пытается самостоятельно найти путь к результату.

Преимущества такого подхода очевидны: автоматизация рутинных операций, более простой доступ к сложному программному обеспечению, возможность работы со старыми системами без API и снижение порога входа для пользователей.

Однако до полностью автономного компьютера ещё далеко. Ошибки, безопасность, конфиденциальность и необходимость контроля остаются серьёзными ограничениями. Поэтому GPT-6 Astra правильнее воспринимать не как замену человеку за компьютером, а как важный шаг к новому типу взаимодействия с цифровыми системами.

Если эта технология продолжит быстро развиваться, привычный вопрос «какую программу мне открыть и куда нажать?» постепенно может исчезнуть. Вместо него останется гораздо более простой вопрос: «Что я хочу получить?».

 

Часто задаваемые вопросы

Vibe doing — это концепция взаимодействия с ИИ, при которой пользователь описывает желаемый результат, а искусственный интеллект самостоятельно выполняет необходимые действия в компьютерной среде. Это развитие идеи vibe coding, но уже за пределами программирования.

Vibe coding в основном связан с созданием программного кода по естественному описанию задачи. Vibe doing значительно шире: ИИ может использовать существующие программы, сайты и интерфейсы, чтобы выполнить поставленную задачу.

Computer use — способность ИИ взаимодействовать с компьютером через его интерфейс: анализировать содержимое экрана, перемещать указатель, нажимать элементы, вводить текст и выполнять последовательность действий.

Пока нет. Даже высокие результаты специализированных тестов означают, что модель всё ещё допускает ошибки. Для важных и ответственных операций необходим контроль человека.

Такой подход позволяет взаимодействовать с огромным количеством программ и сайтов даже в тех случаях, когда для них не существует API или специальной интеграции. Агент может использовать интерфейс примерно так же, как это делает человек.

В ближайшем будущем маловероятно. Голосовое управление и автономные агенты будут дополнять традиционные способы взаимодействия. Для многих точных профессиональных задач мышь и клавиатура останутся удобными.

Да, потенциально это создаёт дополнительные риски. Агент с широкими разрешениями может ошибиться, изменить данные или выполнить нежелательное действие. Поэтому важными становятся ограничения доступа, подтверждение критических операций и возможность остановить выполнение.

Это одно из наиболее интересных направлений развития computer use. Теоретически агент сможет взаимодействовать с программами через их визуальный интерфейс даже без специальной интеграции. Однако для надёжности специализированные API и прямые интеграции пока остаются предпочтительнее.

Работа с компьютером может стать более ориентированной на результат. Вместо изучения большого количества меню и последовательностей действий пользователь сможет формулировать задачу обычным языком, а ИИ будет брать на себя значительную часть механической работы.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

двенадцать − 9 =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала