Новое исследование показывает, что более сильные модели ИИ могут создавать временные рамки вывода, чтобы значительно повысить производительность более слабых моделей без необходимости обновления параметров. Этот метод, называемый каркасом от сильного к слабому, эффективен...
Новое исследование показывает, что более сильные модели ИИ могут создавать временные рамки вывода, чтобы значительно повысить производительность более слабых моделей без необходимости обновления параметров. Этот метод, получивший название «структура от сильного к слабому», эффективно переносит рассуждения в детерминированный код и структурированную маршрутизацию, почти удваивая точность целевой модели в тестах теории разума.
📖 Читать статью о Пневметроне полностью →
Что изменилось
В течение многих лет стандартным подходом к улучшению небольших языковых моделей была дистилляция во время обучения. Этот процесс включает обновление параметров меньшей модели, чтобы имитировать поведение более крупной и более способной модели «учителя». Несмотря на свою эффективность, это требует значительных вычислительных ресурсов, специализированных наборов данных и неизбежного риска катастрофического забывания или переобучения в процессе тонкой настройки. В новом исследовательском документе «AI4AI во время испытаний: передача возможностей от сильных к слабым через жгуты» предлагается фундаментальный сдвиг: перенести процесс передачи со времени обучения на время вывода.
Вместо того, чтобы изменять веса меньшей модели, исследователи разработали метод, называемый каркасом от сильного к слабому. В этой парадигме мощная