Автором этой записи в блоге является Бартош Котрис. Здравый смысл гласит: поручить работу сильной модели и позволить более дешевым моделям делать всю работу. Я соединил четыре модели Claude вместе в Claude Code, чтобы проверить этот совет на Terminal-Bench 2.1, эталонном тесте...
Автором этой записи в блоге является Бартош Котрис.
Здравый смысл гласит: поручить работу сильной модели и позволить более дешевым моделям делать всю работу. Я объединил четыре модели Claude в Claude Code, чтобы проверить этот совет на Terminal-Bench 2.1, эталонном тесте, который помещает агента в изолированный терминал и просит его решить 89 реальных задач командной строки, от компиляции проектов до восстановления паролей, с пятью попытками для каждой. Оценка — это просто доля задач, которые удается решить агенту, и я запускал ее на официальных условиях.
Это имело неприятные последствия четырьмя разными способами:
Делегация уговорила Opus отказаться от действительных задач по обеспечению безопасности.
Шаг проверки, который я оставил необязательным, был пропущен, а непроверенная работа выполнялась вдвое реже.
Самая дорогая модель оказалась на месте с самым большим объемом продаж.
Всякий раз, когда оркестратор проходил более шести передач, он тратил почти в четыре раза больше, чтобы добиться успеха в два раза реже.
Окончательный счет составил 1178 долларов, и система решила 78% задач эталонного теста, что поставило его на седьмое место, примерно вдвое дороже, чем у лучшей одиночной модели. Вот установка из четырех моделей, на которой он был создан, подключенная через Claude Code без стороннего фреймворка:
Каждая вторая запись на доске
