Каждые несколько недель в моей ленте появляется очередной релиз модели в открытом весе — в последнее время разговоры велись вокруг новейших записей MiniMax, а до этого — чужих. Цикл всегда один и тот же: впечатляющие графики запуска, волна горячего…
Каждые несколько недель в моей ленте появляется очередной релиз модели в открытом весе — в последнее время разговоры велись вокруг новейших записей MiniMax, а до этого — чужих. Цикл всегда один и тот же: впечатляющие графики запуска, волна горячих отзывов, а затем тихий вопрос, который действительно важен для моей повседневной работы: помогает ли эта штука мне с моим кодом, в моем репозитории, в моих задачах?
Я перестал доверять тестам запуска для этого решения. Не потому, что они нечестны, а потому, что они отвечают на другой вопрос. Поэтому я выработал небольшую, повторяемую привычку оценки, которую использую всякий раз, когда появляется новая модель. Это занимает около 30 минут, ничего не стоит, если у вас есть доступ к бесплатному хостингу моделей, и, что более важно, это дает доказательства, которые я могу защитить в ходе пиар-дискуссии, а не в виде флюидов.
Этот пост посвящен рабочему процессу, включая обвязку. Он не зависит от инструмента, но я отмечу, где я его запускаю.
Почему тесты в день запуска не отвечают на мой вопрос
Публичные тесты измеряют производительность при выполнении курируемых задач с помощью понятных подсказок. Мое реальное использование более запутанное:
Многофайловый контекст с устаревшими комментариями и частично перенесенными API
Инструкции, которые противоречат друг другу («сохраняйте минимальные различия» или «также исправьте именование»)
Треска