Webrium
Подписаться

Что такое ИИ-агент и почему о нём все спорят

Чем ИИ-агент отличается от ассистента, почему дело не в уме модели, и где на самом деле проходит настоящий спор вокруг таких систем

Поле, разделённое швом: слева ассистент, который лишь отвечает текстом, справа агент, который сам выполняет действия; элементы пересекают границу, показывая, чтАссистент отвечаетАгент делает

«ИИ-агент» — слово, которое сейчас приклеивают к чему угодно, и именно из-за этого вокруг него так шумно. Спросите у поисковика, что это такое, — ответы не сойдутся. Где-то агентом назовут чат-бота с парой дополнительных кнопок. Где-то — систему, которая сама доводит задачу от начала до конца, пока человек занимается своими делами. Между этими двумя картинками помещается весь нынешний ажиотаж.

Разберём, что за этим стоит, — без терминов, на том, как такие системы устроены. Заодно найдём, где проходит настоящий спор. Спойлер: он не про ум.

Ассистент отвечает, агент — делает

Начнём с того, что вы уже видели. Обычный ИИ-ассистент — это диалог: вы пишете запрос, он пишет ответ. Один такт. Даже если ответ выглядит как план — «сначала найдите рейс, потом заполните форму» — сами действия не происходят. Модель умеет превращать текст в текст, и на этом её участие в мире заканчивается.

Агент устроен иначе. Той же модели вокруг строят обвязку: список действий, которые она может запускать сама, — поискать, открыть таблицу, отправить письмо, вызвать другую программу; память о том, что уже сделано; правило, по которому выбирается следующий шаг; и ограничения — чего делать нельзя. Главное в этой конструкции — цикл: агент делает шаг, смотрит на результат, решает, что делать дальше. Ему не выдают готовую последовательность — он строит её сам и правит по ходу, когда результат не тот.

Как это выглядит. Задача: «оформи мне поездку на конференцию». Агент ищет варианты, сверяет даты с календарём, замечает пересечение с другим событием, сам меняет план, бронирует — и в конце отчитывается, что сделал и почему. Каждый переход здесь — его решение, а не пункт чужого сценария. Ассистент на том же запросе выдал бы список ссылок, а бронировать пришлось бы вам.

Отсюда самая честная аналогия: агент — не «очень умный чат-бот», а сотрудник. Консультанту вы задаёте вопросы и всё делаете сами. Сотруднику даёте задачу и доступы — он сам ходит по системам и приносит результат. Агент — это второе. Причём дело не в уме: не самая умная модель с циклом и доступами всё равно агент, просто плохой. А самая умная модель без цикла — не агент, как ни крути.

И важное следствие: «быть агентом» — свойство не модели, а конструкции вокруг неё. Одна и та же модель в понедельник отвечает в чате, а во вторую собирает отчёты в роли агента. Мозг не менялся — поменяли обвязку. Так что вопрос «а эта модель агентная?» смысла не имеет: агентной бывает система.

Бытовой тест напоследок: если приложению можно поставить задачу и отойти, а потом вернуться к готовому результату — оно устроено в сторону агента. Если на каждом шагу нужно ваше «дальше» — это диалог, и называться он может как угодно.

Почему спорят даже о слове

«Агентом» сейчас называют и кнопку «заказать» рядом с чат-ботом, и систему, которая сутками сама ходит по базам и наводит порядок. Общего у них только слово. Внятного порога никто не зафиксировал: сколько самостоятельных решений должна принимать система, чтобы заслужить название, — не договорились. Поэтому, когда двое спорят «за» и «против агентов», они часто говорят о разных вещах: один защищает кнопку, второй ругает то, что сутками делает само.

Вывод простой: услышав «у нас агент», не спорьте об умности. Спросите, что именно система делает сама, без человека между шагами. Ответ скажет больше, чем название.

Настоящий спор: ошибка становится действием

Когда модель ошибается текстом, это неприятно, но поправимо: неверный ответ можно проигнорировать или переспросить. Когда ошибается агент, он ошибается действием. Отправленное письмо само не вернётся, изменённая запись в таблице не вспомнит, какой была. Как только система начинает что-то делать, цена ошибки меняет категорию — и весь спор об агентах, если убрать шум, крутится вокруг одного: сколько решений можно отдать без проверки.

Дальше работает арифметика, и она не на стороне длинных цепочек. Оцените для себя шанс ошибки на одном шаге — подставьте любую цифру, какая кажется честной. Чтобы цепочка прошла до конца чисто, нужно, чтобы не споткнулся ни один шаг: шансы перемножаются. На короткой цепочке это незаметно. На длинной даже скромная вероятность ошибки на шаг делает безупречное прохождение редким. Заметьте: это не «модель недостаточно умная», это устройство самой петли. Ум не отменяет умножения.

Поэтому и разумная схема внедрения выглядит так: сначала узкий набор действий и подтверждение человека на каждом шаге; если система не путается — права расширяют. Это не бюрократия. Пока агент может только предложить, а не сделать, ошибка остаётся дешёвой.

Отсюда главный вопрос к любой агентной системе: не «пройдёт ли она демо-путь», а «заметит ли она, что шаг не удался, и умеет ли исправиться». Что отказывает, когда агент работает долго? Не путь из презентации, а всё вокруг него — память, контроль, восстановление, наблюдение. Об этом у нас есть отдельный разбор — «Агенты в продакшене: что отказывает на второй неделе».

Есть и линия спора о границе. Часть систем, которые продают как агентов, — жёсткий сценарий: последовательность шагов записана заранее, а модель лишь заполняет тексты. Это не хуже и не лучше, это другой класс. Сценарий предсказуем, его можно выверить заранее. Агент гибок, он сам выбирает следующий шаг — в этом его сила и в этом же его уязвимость. Выбор между ними — это выбор того, что вы готовы не проверять.

Самый частый пример «инструмента» агента — поиск: агент сам находит информацию, вместо того чтобы знать её заранее. Но и тут скромнее, чем в презентациях: поиск решает меньше, чем принято считать. У нас об этом отдельный спор — «Поиск решает меньше, чем принято считать».

Тупик: проверить агента как чат-бот

Когда человек впервые сталкивается с агентом, он делает предсказуемую вещь — тестирует его как чат-бот. Задаёт вопрос посложнее и смотрит, насколько умно тот отвечает. Или смотрит чужое демо и оценивает гладкость. Соблазн понятен: других инструментов проверки у обычного читателя просто нет.

Не работает это вот почему. От ассистента агент отличается не качеством отдельного ответа, а поведением в цепочке шагов. Красивый одиночный ответ ничего не говорит о том, заметит ли система, что шаг не удался; отличит ли «пока не получается» от «не выйдет никогда»; остановится ли, когда задача решена; не станет ли ходить по кругу. Все эти свойства живут в петле, а не в тексте. Демо тем более ловушка: показывают один удачный путь, а спор всегда о всех остальных путях. После «теста на умность» вы знаете о системе то же, что знали до него.

Что вместо, одной строкой: смотреть не на удачный прогон, а на поведение в момент, когда что-то ломается. Как это выглядит на длинной дистанции — в материале про продакшен.

Позиция редакции

Наша позиция: спор об агентах — не спор об интеллекте моделей. Это спор о том, сколько промежуточных решений человек готов отдать системе без проверки. Поэтому слово «агент» стоит понимать не как похвалу, а как обозначение уровня доступа: агент — тот, кому можно что-то сделать без спросу. Практическая рамка отсюда простая: встречая очередное «агентное» объявление, спрашивайте не «насколько он умный», а «что он может сделать сам, пока меня нет». Ответ на второй вопрос скажет, стоит ли волноваться. Ответ на первый — нет.

Мы можем ошибаться, и условие ошибки назовём явно. Если окажется, что качество одиночного ответа напрямую предсказывает поведение в петле — то есть с улучшением базовых моделей ошибки в цепочках шагов исчезают сами, без ограничений и без человеческого права вето, — наша граница не нужна. Тогда агент отличался бы от чат-бота только скоростью, и весь спор свёлся бы к цене. Но пока всё, что видно из устройства таких систем, говорит об обратном: петля добавляет собственные способы ошибиться, и они не исчезают вместе с красотой текста.

С чем это связано

Метка над заголовком говорит, зачем туда идти: продолжить тему, перейти к практике или увидеть возражение.

Шесть растущих столбцов: при том же коде контекст запроса агента увеличивается с каждым шагом истории, в продакшене уходя далеко за уровень показаКонтекст растёт
Углубление

Агенты в продакшене: что отказывает на второй неделе

Почему сбои многошаговых агентов почти никогда не начинаются с модели, как предсказать их до запуска и где агент ломается раньше всего.

Четыре датчика: три показателя поиска в норме, четвёртый — ответы агента — зашкаливает. Метрики поиска красивые, а агент отвечает мимо: поломка живёт не в ретриагент всё ещё мимо
Спор

Поиск решает меньше, чем принято считать

В спорах об агентах первым делом винят поиск. Редакция не согласна: поломка не в ретривере — за вечер можно найти настоящее слабое звено и понять, что крутить вместо него.

Сетка прогонов агента: успешными заполнена лишь часть ячеек, рядом счётчик типов отказовтипы отказов
Практика

Оценка качества агента до релиза

Что такое агент, теперь понятно; дальше — практика. Один успешный прогон ничего не доказывает: как выстроить оценку, которая до релиза покажет характерные отказы.

Описание инструментов как контракт: стык сходится или расходитсясходитсяразошлось
Углубление

Протокол вместо фреймворка: что изменилось в сборке агентов

Глубже про устройство: где проходит граница между вашим циклом и чужими системами и что протокольный обмен не решает.

Письмо по вторникам

Один разбор недели и короткий список того, что изменилось. Без дайджестов на сорок ссылок.

Начните вводить — материалы появятся здесь.

выбрать · Enter открыть · Esc закрыть