Перестаньте спрашивать: «Какой LLM лучше?» – Спросите, какая модель подходит для этой рабочей нагрузки В прошлом квартале я был по локоть в финтех-продукте, который должен был превратить шумные банковские выписки в чистые отчеты о расходах. Моим первым инстинктом было схватить «самый большой» LLM, например...
Перестаньте спрашивать: «Какой LLM лучше?» – Спросите, какая модель подходит для этой рабочей нагрузки
В прошлом квартале я был по локоть в финтех-продукте, который должен был превратить шумные банковские выписки в чистые отчеты о расходах. Моим первым инстинктом было схватить «самый большой» LLM, запустить GPT-4, Claude-2, Gemini-1.5 и надеяться, что он волшебным образом поймет каждую колонку, валюту и странную аббревиатуру. После выходных, проведенных с проверками задержек, подсчетами затрат и огромным количеством журналов ошибок, я понял, что «лучшая» модель во всех общедоступных таблицах лидеров по-прежнему не учитывает наш реальный KPI: цену за успешный анализ.
Решение заключалось в том, чтобы перестать относиться к LLM как к блестящим игрушкам и начать относиться к ним как к заменяемым услугам. Я перечислил размеры, которые действительно имели значение:
возможности (финансовый жаргон, таблицы)
рассуждение (многоступенчатое извлечение без галлюцинаций)
задержка (<300 мс для плавного пользовательского интерфейса)
длина контекста (операторы могут быть 10 тыс. токенов)
модальность (иногда мы получаем изображение в формате PDF, поэтому генерация OCR+ имеет значение)
стоимость (каждый вызов API съедает нашу прибыль)
Затем я создал небольшой тест, который точно отражает рабочий процесс: подает реальный отчет, запрашивает позиции в формате JSON, измеряет успех (анализ JSON, итоговые значения совпадают). Я тестировал три сервиса: OpenAI gpt‑3.5‑turbo‑16k, AW.