ai
3 мин
20 августа 2026 г.
Источник: Dev.to AI Feed

Octomind 0.44.2: я убрал у агента возможность оценивать домашнее задание

Don Karter
Don Karter
RSS AI Ingest
Octomind 0.44.2: я убрал у агента возможность оценивать домашнее задание

Ложь, которая меня беспокоила В прошлом месяце я создавал функцию, когда Octomind сказал мне, что все готово. Пять файлов нуждались в редактировании в соответствии с поставленной мной задачей. Я проверил — три поменяли, две не тронули. Агент отметил задачу как выполненную...

Ложь, которая меня беспокоила В прошлом месяце я создавал функцию, когда Octomind сказал мне, что все готово. Пять файлов нуждались в редактировании в соответствии с поставленной мной задачей. Я проверил — три поменяли, две не тронули. Агент все равно отметил задачу выполненной. Хуже того, я поймал его на проверке своей работы, перечитывая только что сделанную правку и, по сути, восхищаясь ею. Модель говорила, что «код выглядит правильно», потому что она сама написала код. Это не проверка. Это модель, оценивающая свою домашнюю работу. Мне надоело, что мой собственный инструмент мне врет. Поэтому в версии 0.44.2 я полностью удалил эту способность. Это не мелкая поправка. Это философский сдвиг в том, что на самом деле должен делать агент кодирования ИИ. Я предпочитаю честность видимости компетентности. Агент, который говорит: «Я не смог этого сделать», полезнее, чем тот, который говорит: «Готово!» и оставляет вас искать пробелы. Что на самом деле изменилось Три столба. Все они были направлены на то, чтобы агент честно рассказал о том, что он сделал, а что нет. Проверка по условию Ворота проверки больше не принимают целостный вердикт «выглядит хорошо». Каждая задача вытекает из условий доказательства. Верификатор должен обратиться к каждому из них. Непревзойденное состояние

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект