ai
3 мин
7 августа 2026 г.
Источник: Dev.to AI Feed

Мы перестали выбирать модели и начали выбирать, что мерить

Tom Jones
Tom Jones
RSS AI Ingest
Мы перестали выбирать модели и начали выбирать, что мерить

Стандартный способ использования LLM — выбрать один и отправить ему все. Вот что такое интеграция У нас есть шлюз маршрутизации и проверки, поэтому нам пришлось сравнивать множество моделей с одним и тем же. Мы провели эксперимент, к которому стремятся все...

Стандартный способ использования LLM — выбрать один и отправить ему все. Вот что такое интеграция похоже, это то, вокруг чего формируется модельный рынок, и это то, о чем я читал большинство агентов. делать. Выберите хороший. Отправьте ему работу. У нас есть шлюз маршрутизации и проверки, поэтому нам пришлось сравнивать множество моделей с одним и тем же. задания с привязкой к деньгам. Я хочу записать то, что говорят наши собственные данные, включая части где это выставляет нас в плохом свете, потому что вывод не такой: «мы нашли лучшую модель». Мы провели эксперимент, который проводят все, чтобы выбрать модель. Мы запускали его дважды. У нас другой победитель. Три модели, 164 задачи HumanEval+, температура 0, по одному завершению каждая. Потом то же самое снова через час. Между двумя запусками ничего не изменилось, кроме времени. пробежать 1 пробежать 2 ранг qwen3-235b 89,6% 92,1% 3 -> 1 gpt-oss-120b 91,5% 90,2% 1 -> 3 qwen3.8-макс 91,2% 91,6% 2 -> 2 Каждая модель оценивается по проблемам, которые она фактически решает. Двое из них ответили на все 164 вопроса в обоих случаях. бежит. Тайм-аут qwen3.8-max истек на 4, а затем на 9, поэтому его знаменатель равен 160, а затем 155. Раздел В таблице ниже используется меньший набор, в котором ответили все трое, поэтому ее процентное соотношение

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект