У ИИ-агентов есть удивительно простая проблема с надежностью: Они часто путают выполнение действия с выполнением задачи. Агент нажимает кнопку. Вызов инструмента завершается успешно. Модель предполагает, что работа завершена. И тогда вы получите: Готово ✅ Но...
У ИИ-агентов есть удивительно простая проблема с надежностью:
Они часто путают выполнение действия с выполнением задачи.
Агент нажимает кнопку.
Вызов инструмента завершается успешно.
Модель предполагает, что работа завершена.
И тогда вы получите:
Готово ✅
Но, возможно, страница вернула ошибку.
Возможно файл не был создан.
Возможно, сообщение не было отправлено.
Возможно, приложение так и не открылось.
Акция удалась.
Задача не выполнена.
Проблема ложного завершения
Представьте, что вы спрашиваете агента:
«Создайте документ Google под названием «План проекта».
Наивный агент может:
Открыть Документы Google
Нажмите «Новый документ»
Введите название
Сообщить об успехе
Но нажатие кнопок не является доказательством того, что документ действительно существует.
Для автономных агентов это становится серьёзной проблемой.
Чем дольше рабочий процесс, тем хуже он становится.
Одно неверное предположение в начале процесса может сделать каждый последующий шаг бесполезным.
Как HeyAgent с этим справляется
При создании HeyAgent я решил, что выполнение последнего действия не должно автоматически означать завершение задачи.
Основной рабочий процесс выглядит следующим образом:
текст
Запрос
↓
План
↓
Выполнить
↓
Проверить
↓
Успех
И если проверка не удалась:
Выполнить
↓
Проверить
↓
Обнаружен сбой
↓
Повторить/продолжить exe