Логотип
Радоваться в одиночку — грустно (Лессинг).

Jev: ИИ, который не умеет писать текст — и именно поэтому может оказаться полезным

Jev: ИИ, который не умеет писать текст — и именно поэтому может оказаться полезным

Современный искусственный интеллект почти всегда ассоциируется с текстом. Пользователь задаёт вопрос, модель генерирует ответ, а затем человек или другая программа пытается понять, что именно получилось. Но новый проект TypeSafe AI предлагает посмотреть на эту архитектуру с другой стороны: если компьютеру от искусственного интеллекта вообще не нужен красивый текст, зачем заставлять модель его создавать?

Компания TypeSafe AI представила Jev — модель нового класса, которую разработчики называют System One Model. Её задача заключается не в том, чтобы вести диалог, писать статьи или генерировать код, а в принятии быстрых структурированных решений, которые непосредственно может использовать программное обеспечение. Иными словами, на вход поступают данные, а на выходе — не абзац текста, а заранее определённый набор вариантов с вероятностями и оценкой уверенности.

За проектом стоит Диого Алмейда, ранее работавший в OpenAI. Он участвовал в фундаментальной работе над InstructGPT и RLHF — подходом, который впоследствии стал важной частью развития современных моделей, ориентированных на выполнение инструкций. OpenAI также указывает Алмейду среди участников работы над RLHF и InstructGPT.

 

Почему ИИ вообще должен перестать писать?

Большие языковые модели построены вокруг последовательной генерации. Упрощённо говоря, модель получает контекст и затем шаг за шагом выбирает следующий токен. Так можно получить практически что угодно: ответ на вопрос, программу, электронное письмо, SQL-запрос или длинное рассуждение.

Для человека это очень удобно. Но для компьютерной системы такой подход не всегда рационален. Допустим, банковская система должна решить, подозрительна ли операция. Ей совершенно не нужен текст вроде «данная транзакция имеет некоторые признаки потенциального мошенничества». Программе достаточно получить структурированный результат:

  • риск: высокий;
  • требуется проверка человеком: да;
  • вероятность высокого риска: 0,91;
  • приоритет: высокий.

 

Обычная языковая модель тоже может сформировать JSON с подобными полями. Однако сначала она фактически решает задачу через генерацию последовательности токенов, а затем программному обеспечению приходится проверять полученный результат.

TypeSafe предлагает убрать саму необходимость генерации текста. Jev сразу ориентирован на структурированные значения, которые программа может использовать непосредственно.

 

Что такое Jev

Jev — первый публичный представитель нового класса моделей TypeSafe, который компания называет System One Models. Название связано с различием между быстрым и медленным мышлением из работ Даниэля Канемана: TypeSafe использует эту концепцию как метафору для моделей, предназначенных для быстрых решений внутри программных систем.

В официальном описании TypeSafe Jev представлен как своеобразная функция принятия решений: на вход поступает неструктурированное состояние, а на выходе программа получает типизированные вероятностные решения. Модель не обязана объяснять свой ответ человеку и не должна самостоятельно придумывать формат результата.

Например, интернет-магазин может передать модели сведения о заказе, пользователе и предыдущих действиях. Jev может оценить несколько независимых признаков и вернуть вероятности, которые затем используются обычным кодом для выбора дальнейшего действия.

Это важное отличие от чат-бота. Чат-бот ориентирован прежде всего на взаимодействие с человеком, тогда как Jev проектируется как компонент программной системы.

 

Почему отсутствие генерации текста ускоряет модель

Главная техническая идея заключается в отказе от последовательной генерации строк. При обычном использовании LLM каждый новый токен зависит от предыдущих. Чем длиннее ответ, тем больше вычислений требуется выполнить последовательно.

Jev, согласно TypeSafe, использует параллельный способ получения решений. Если возможные ответы заранее определены схемой, нет необходимости генерировать длинную последовательность символов, чтобы сообщить программе одно из этих значений.

TypeSafe заявляет, что для задач, соответствующих архитектуре System One, Jev способен работать в десятки и сотни раз быстрее традиционных LLM. На странице проекта компания приводит показатель до 193,6 раза большей скорости и до 444,6 раза меньшей стоимости в одном из своих workflow-тестов. При этом сама TypeSafe подчёркивает, что это результаты её собственных оценок, а не универсальный показатель превосходства над всеми языковыми моделями.

Компания указывает для Jev стоимость входных данных на уровне 0,042 доллара за миллион токенов, или 42 доллара за миллиард токенов. Генерация выходных токенов в привычном смысле отсутствует, поэтому TypeSafe называет её практически бесплатной относительно стоимости обработки входа.

Читать  У OpenAI и Apple появилась новая навязчивая идея: использовать ИИ как кратчайший путь к неэкранному режиму

Это особенно интересно для сценариев, где модель должна обрабатывать огромное количество небольших решений. Если алгоритм должен проверять миллионы событий, каждая лишняя миллисекунда и каждый дополнительный токен превращаются в существенные расходы.

 

ИИ для программ, а не для людей

В этом и заключается основная философия TypeSafe. Современные LLM во многом являются интерфейсом между человеком и машиной: человек формулирует запрос естественным языком, модель отвечает естественным языком.

Но огромный пласт будущих применений искусственного интеллекта вообще не требует участия человека на каждом шаге.

Представим систему мониторинга. Она получает миллионы событий в секунду и должна классифицировать их, выбирать маршрут обработки и отправлять подозрительные случаи оператору. В таком сценарии длинный текстовый ответ является скорее препятствием, чем преимуществом.

Здесь можно использовать ИИ как интеллектуальную часть условного оператора:

  • если вероятность мошенничества выше заданного порога — отправить операцию на проверку;
  • если уверенность модели недостаточна — передать решение человеку;
  • если риск низкий — продолжить обработку автоматически;
  • если событие относится к определённому классу — направить его в соответствующий сервис.

 

При этом бизнес-правила остаются в обычном программном коде, а модель становится компонентом, который оценивает ситуацию там, где заранее написанных правил недостаточно.

 

Что означает «типизированный» результат

Одно из ключевых преимуществ Jev связано не только со скоростью, но и с форматом ответа.

У обычной LLM можно попросить вернуть одно из трёх значений: «низкий», «средний» или «высокий». Но языковая модель теоретически способна вернуть что-то ещё: «очень высокий», пояснение, лишний текст или нарушить ожидаемый JSON-формат.

В TypeSafe утверждают, что Jev принципиально работает с заранее определёнными типами. Если разработчик разрешил только определённый набор вариантов, модель не может выдать четвёртый вариант в рамках этой схемы.

Это позволяет компании говорить об отсутствии так называемых type errors — ошибок структуры. Но здесь важно разделять два совершенно разных понятия.

Модель может гарантированно вернуть допустимое значение и при этом ошибиться в самом выборе. Например, если разрешены только «низкий», «средний» и «высокий», она не выдаст «критический», но вполне может выбрать «высокий», когда правильным ответом был «низкий».

Поэтому типобезопасность не означает безошибочность.

 

А что с галлюцинациями?

TypeSafe использует довольно необычную формулировку и заявляет для Jev нулевую долю галлюцинаций. Однако компания сама делает важную оговорку: этот показатель относится к гарантированной структуре результата, а не к правильности каждого решения.

Если модель обязана выбрать один вариант из заранее определённого набора, она действительно не сможет «придумать» новый вариант. Но она всё ещё может ошибиться в оценке исходных данных.

Например, система получает сведения о клиенте и должна определить вероятность мошенничества. Допустимые значения могут быть только от 0 до 1. Получение числа 0,93 не является галлюцинацией в смысле нарушения формата. Но если реальная вероятность существенно ниже, решение всё равно окажется ошибочным.

Именно поэтому гораздо важнее другая часть подхода TypeSafe — калибровка вероятностей.

 

RLCD: обучение не только правильному ответу, но и уверенности

Новый подход TypeSafe называется Reinforcement Learning for Calibrated Decisions, или RLCD — обучение с подкреплением для калиброванных решений.

Идея заключается в том, что модели недостаточно просто выбрать ответ. Она должна сообщить, насколько уверена в своём выборе. Для автоматизации это принципиально важно.

Представим два результата. В первом случае система говорит: «риск высокий, уверенность 99%». Во втором: «риск высокий, уверенность 52%». Человек может обработать эти ситуации совершенно по-разному.

В первом случае программу можно настроить на автоматическое действие. Во втором — отправить событие оператору.

Таким образом, вероятность становится частью интерфейса между ИИ и программным кодом. Это особенно полезно там, где абсолютная уверенность невозможна, но необходимо принимать решения в условиях неопределённости.

 

Где такой ИИ может применяться

Концепция Jev особенно хорошо подходит для задач, в которых есть много повторяющихся решений и заранее определённые варианты ответа.

  • антифрод и оценка финансовых операций;
  • маршрутизация запросов между сервисами;
  • классификация обращений клиентов;
  • автоматическая модерация;
  • оценка рисков;
  • системы обнаружения аномалий;
  • проверка результатов работы других моделей;
  • задачи реального времени, где критична задержка;
  • обработка больших массивов данных;
  • управление агентными системами и выбор следующего действия.
Читать  Глава Intel по искусственному интеллекту уходит в отставку и присоединяется к OpenAI

 

Особенно интересным выглядит последний сценарий. Агенту не обязательно каждый раз писать человеку длинное объяснение. Внутри сложной системы ему может требоваться постоянно выбирать следующее действие из нескольких возможных.

В таком случае модель, способная быстро выдавать структурированные решения, потенциально может оказаться более удобной, чем универсальная LLM.

 

Doom и Wikipedia как демонстрация концепции

TypeSafe показала несколько демонстраций Jev. В одной из них модель управляет персонажем в Doom, принимая около десяти решений в секунду. Компания оценивает стоимость такой работы примерно в семь долларов в час.

В другой демонстрации модель участвует в Wikiracing — игре, в которой нужно перейти с одной страницы Wikipedia на другую, выбирая ссылки на каждом шаге.

Эти примеры интересны не потому, что Jev может лучше игрового бота или быстрее человека. Самая важная часть демонстраций — возможность показывать, как модель принимает большое количество последовательных решений, не создавая каждый раз текстовое объяснение.

При этом TypeSafe отдельно указывает ограничения своих демонстраций. Например, тест Doom работает со структурированным состоянием игры, а не с изображением экрана. Поэтому говорить о полноценном визуальном компьютерном зрении на основании этой демонстрации нельзя.

 

Почему заявления о сотнях раз быстрее стоит воспринимать осторожно

Цифры TypeSafe выглядят впечатляюще, но их нельзя автоматически переносить на любую задачу искусственного интеллекта.

Во-первых, сама компания тестирует новый тип модели на задачах, для которых он предназначен. Во-вторых, сравнение зависит от того, какие именно модели LLM выбраны, как они настроены и каким образом их заставляют возвращать структурированный результат.

TypeSafe сама признаёт, что некоторые опубликованные workflow создавались членами команды, работающей над возможностями модели. Компания также указывает другие ограничения своих оценок и подчёркивает необходимость дальнейшего тестирования.

Поэтому корректнее воспринимать заявленные 193,6x и 444,6x не как универсальные характеристики «новой модели против всех LLM», а как результат конкретных сравнительных сценариев.

Для реального внедрения потребуется проверять Jev на собственных данных, собственных задержках, стоимости инфраструктуры и требуемой точности.

 

Jev не заменяет ChatGPT

Самая важная мысль нового подхода заключается в том, что Jev не пытается заменить универсальные языковые модели.

Если человеку нужно написать письмо, разобраться в технической документации, придумать архитектуру приложения или получить подробное объяснение, текстовая генерация остаётся чрезвычайно полезной.

Но если серверу нужно каждую секунду принять тысячи решений, текст может быть ненужным промежуточным слоем.

В таком мире разные модели могут выполнять разные роли. Одна система разговаривает с пользователем, другая анализирует документы, третья пишет код, четвёртая принимает короткие структурированные решения внутри инфраструктуры.

Именно это направление может оказаться одним из важных элементов развития AI-систем: не одна гигантская модель, делающая всё подряд, а набор специализированных интеллектуальных компонентов.

 

Парадокс эффективности и название Jev

Название модели связано с британским экономистом Уильямом Стэнли Джевонсом и так называемым парадоксом Джевонса.

В упрощённом виде идея заключается в том, что повышение эффективности использования ресурса не обязательно уменьшает его общее потребление. Если ресурс становится дешевле и доступнее, спрос на него может вырасти настолько, что итоговое потребление увеличится.

TypeSafe переносит эту идею на вычислительный интеллект. Если стоимость интеллектуального решения резко снизится, это не обязательно означает сокращение использования ИИ. Напротив, организации смогут применять модели там, где раньше их использование было экономически бессмысленным.

Например, компания может не использовать дорогую модель для анализа каждого отдельного события. Но если стоимость одного решения станет настолько низкой, что можно будет анализировать каждое событие, архитектура программного обеспечения изменится.

В этом случае более дешёвый ИИ способен не уменьшить число вычислений, а создать огромный новый рынок для них.

 

Что это может изменить в разработке программ

Если идея TypeSafe окажется жизнеспособной, разработчики получат ещё один способ интеграции машинного интеллекта в приложения.

Сегодня типичная архитектура выглядит примерно так: программа отправляет запрос LLM, получает текст или JSON, проверяет его, обрабатывает ошибки и принимает решение.

В модели System One предполагается обратная философия: сама интеллектуальная система должна быть частью вычислительного графа и возвращать значения, которые программный код способен использовать напрямую.

Это сближает ИИ с обычными функциями и API. Разница заключается в том, что заранее запрограммировать все правила невозможно, поэтому часть логики передаётся обученной модели.

Особенно интересным становится сочетание вероятностного ИИ с детерминированным кодом. Модель может оценивать ситуацию, а обычная программа — определять последствия этой оценки. Это позволяет не отдавать ИИ полный контроль над системой.

Читать  В рекламе ChatGPT от OpenAI якобы будет отдаваться предпочтение спонсируемому контенту в ответах

 

Ограничения нового подхода

У такой архитектуры есть и очевидные ограничения. Jev не является универсальной заменой языковым моделям. Если задача требует свободного текста, сложного объяснения или создания нового содержания, отсутствие генерации строк становится фундаментальным ограничением.

Кроме того, качество решений зависит от обучающих данных, постановки задачи и правильности самой схемы. Нельзя получить надёжную автоматизацию только потому, что модель гарантирует корректный формат ответа.

Есть и ещё один важный вопрос — переносимость результатов. Модель может отлично работать на одном типе бизнес-процесса и существенно хуже на другом. Поэтому реальные показатели необходимо измерять непосредственно на производственной задаче.

Наконец, проект находится на раннем этапе. TypeSafe только открыла ранний доступ к Jev и предлагает разработчикам тестировать модель на собственных сценариях. Поэтому сейчас правильнее говорить о перспективном архитектурном направлении, чем о состоявшейся замене традиционных LLM.

 

Выводы

Jev представляет интерес не как универсальная замена ChatGPT или другим большим языковым моделям, а как попытка создать отдельный класс ИИ для программной автоматизации. Вместо генерации текста модель возвращает заранее определённые структурированные решения, сопровождая их вероятностями и оценкой уверенности.

По данным TypeSafe AI, такой подход позволяет значительно сократить задержку и стоимость обработки задач, в которых модели требуется постоянно выбирать одно из нескольких действий. Компания заявляет о времени ответа порядка 70–500 миллисекунд и возможности получить преимущество в скорости в 40–200 раз на задачах соответствующего типа. Эти показатели относятся к собственным тестам TypeSafe и требуют независимой проверки на других сценариях.

Самая интересная часть концепции заключается в разделении функций. Большая языковая модель может взаимодействовать с человеком и генерировать сложные ответы, а специализированная модель вроде Jev — работать внутри программного кода, классифицировать события, выбирать маршрут обработки, оценивать риск или принимать следующее действие.

Такой подход особенно актуален для будущих ИИ-агентов. Агенту далеко не всегда необходимо писать человеку объяснение каждого промежуточного шага. Во многих случаях ему достаточно быстро определить следующее действие и передать его обычной программной системе.

При этом заявления о «нулевых галлюцинациях» необходимо понимать корректно. Речь идёт о невозможности получить значение за пределами заранее определённой структуры. Это не означает, что модель гарантированно принимает правильное решение. TypeSafe отдельно подчёркивает различие между типовой корректностью результата и правильностью самого решения.

Поэтому Jev пока правильнее рассматривать как интересный эксперимент с новой архитектурой ИИ, а не как доказанную замену существующим LLM. Главный вопрос ближайшего времени — насколько хорошо такой подход покажет себя на независимых производственных задачах.

 

Часто задаваемые вопросы

Jev — первая публичная System One Model компании TypeSafe AI. Она предназначена для быстрого принятия структурированных решений, которые непосредственно используются программным обеспечением.

Официальный анонс опубликован TypeSafe AI: Introducing System One Models & Jev.

Jev разработан компанией TypeSafe AI, основанной Диого Алмейдой. Ранее он работал в OpenAI и участвовал в исследованиях, связанных с обучением языковых моделей следованию инструкциям и RLHF.

Модель ориентирована не на общение с человеком, а на использование внутри программ. Поэтому вместо текстового ответа она возвращает типизированные значения и вероятности.

TypeSafe использует это утверждение в смысле типовой структуры результата: возможные значения заранее определены, поэтому модель не должна выдавать значение, которого нет в схеме. Однако это не означает отсутствия ошибок в самом решении.

RLCD — Reinforcement Learning for Calibrated Decisions, метод обучения, разработанный TypeSafe для получения решений с калиброванными вероятностями и оценкой неопределённости.

TypeSafe сообщает о задержке примерно 70–500 миллисекунд и заявляет о преимуществе в 40–200 раз на задачах, для которых предназначена System One архитектура. Это данные разработчика и их нельзя автоматически распространять на все типы ИИ-задач.

Jev и ChatGPT ориентированы на разные задачи. Jev предназначен для структурированных решений внутри программного обеспечения, тогда как универсальные LLM сохраняют преимущества в генерации текста, диалоге, программировании и других открытых задачах.

Основная информация доступна непосредственно у разработчика: официальный сайт TypeSafe AI и официальный анонс Jev.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

четыре × три =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала