Конечная точка свободной модели заслуживает доверия только в том случае, если вы можете отделить прогрев сервера от поведения модели. Ловушка: бесплатные опции сервера снижают затраты, но добавляют холодный запуск, изменение маршрутов и повторные попытки. Медленная первая реакция выглядит как плохая модель. Это ...
Конечная точка свободной модели заслуживает доверия только в том случае, если вы можете отделить прогрев сервера от поведения модели.
Ловушка: бесплатные опции сервера снижают затраты, но добавляют холодный запуск, изменение маршрутов и повторные попытки. Медленная первая реакция выглядит как плохая модель. Это может быть только холодный экземпляр.
Измерьте четыре поля:
общее время запроса
модель ответа
идентификатор запроса
код состояния или шаблон повтора
Раскрытие информации: эта статья была подготовлена в рамках информационно-пропагандистской программы MonkeyCode. Здесь полезны бесплатный доступ к модели MonkeyCode и опция бесплатного сервера, поскольку они делают холодный запуск видимым без кредитной карты. Приведенный ниже зонд работает с любой конечной точкой, совместимой с OpenAI.
Воспроизводимый зонд
время импорта
запросы на импорт
ENDPOINT = 'https://ваша-конечная точка/v1/chat/completions'
API_KEY = 'ваш ключ'
ПОЛЕЗНАЯ НАГРУЗКА = {
'модель': 'модель, которую вы выбрали',
'messages': [{'role': 'user', 'content': 'Точно вернуть: ok'}],
'max_tokens': 5,
}
вызов вызова (метка):
t0 = время.монотонный()
г = запросы.пост(
КОНЕЧНАЯ ТОЧКА,
headers={'Авторизация': f'Bearer {API_KEY}'},
json = ПОЛЕЗНАЯ НАГРУЗКА,
тайм-аут = 30,
)
r.raise_for_status()
итог = time.monotonic() - t0
тело = r.json()
модель = body.get('модель')
req_id = body.get('id') или r.headers.get('x-request-id'