Агент — это не модель
Одна и та же модель может работать внутри IDE, терминала, облачного воркспейса или собственного графа. Но это не делает эти продукты одинаковыми. Модель предлагает следующий шаг. Агентская среда решает, что модель увидит, какие инструменты получит, где выполнит команды, какие действия потребуют разрешения и чем будет доказан результат.
Поэтому выбирать нужно не «самый умный AI», а рабочий контур: где начинается задача, как человек вмешивается в процесс и что происходит после первой ошибки.
Мера агента — сколько непроверенной работы он оставляет человеку.
Контур работы
Если задача ещё не определена — начните интерактивно. Диагностика, поиск причины и выбор архитектуры требуют частых решений. Здесь полезен агент, который живёт рядом с кодом: в редакторе или терминале.
Если задача описана и независимо проверяется — её можно отправить в фон. Фоновый агент не становится умнее. Он освобождает внимание там, где следующий шаг уже не требует постоянного человеческого решения.
Простой тест: если формулировку нельзя передать коллеге и уйти, её рано отдавать автономному агенту.
Уровень автономии
Автономность должна расти не вместе с уверенностью в модели, а вместе с качеством ограничений. Для документации и тестовых данных можно оставить широкий контур. Платежи, авторизация, инфраструктура и production-данные требуют изоляции, минимальных прав и человека перед необратимым действием.
Цена ошибки определяет окружение сильнее, чем бренд агента. Иногда лучший выбор — локальный запуск без сетевого доступа. Иногда — облачный воркспейс с браузером и воспроизводимой средой. Важно не количество доступных инструментов, а то, какие из них действительно нужны задаче.
Проверка результата
Выбирайте агента по тому, что он способен проверить. Для чистой функции достаточно тестов. Для формы оплаты нужен браузерный сценарий. Для производительности — измерение. Для визуальной работы — реальный экран. Если агент меняет интерфейс, но не может его увидеть, он работает вслепую.
Отчёт «всё готово» ничего не доказывает. Полезный результат связывает требования, изменения и фактические проверки: какие команды запущены, какие сценарии пройдены, какие риски остались человеку.
Практическая карта
- Есть неопределённость? Работайте интерактивно.
- Задача описана и независимо проверяется? Отправляйте в фон.
- Проверка требует браузера, GUI или внешней системы? Выбирайте соответствующее окружение.
- Ошибка дорогая? Сужайте права и оставляйте human gate.
- Процесс повторяется? Сначала зафиксируйте его в небольшом скрипте. SDK или граф добавляйте, когда понадобятся состояние, ветвления, восстановление и наблюдаемость.
Чек-лист постановки задачи
- Записан ожидаемый результат, а не только желаемое действие.
- Названы границы: что менять можно и что трогать нельзя.
- Проверка выполняется одной понятной командой или сценарием.
- Права и секреты не шире, чем требует задача.
- Для дорогого действия есть явная остановка перед человеком.
- В отчёте нужны доказательства, а не пересказ выполненной работы.
Как сравнивать агентов
Возьмите несколько реальных задач одинакового класса и измеряйте не строки кода, а долю принятых результатов, число вмешательств, лишние изменения, качество доказательств, минуты человеческого внимания и стоимость. Домашний eval расскажет о выборе больше, чем универсальный tier-list: он проверяет агента на вашей архитектуре, ваших тестах и вашем уровне хаоса.