Большинство инструментов искусственного интеллекта выглядят впечатляюще в отточенной демо-версии. Более сложный вопрос заключается в том, надежны ли они, быстры и доступны по цене для вашей работы. Общая таблица лидеров не может ответить на этот вопрос. Вашей команде может быть интересно извлечь поля из счетов-фактур, объясните...
Большинство инструментов искусственного интеллекта выглядят впечатляюще в отточенной демо-версии. Более сложный вопрос заключается в том, надежны ли они, быстры и доступны по цене для вашей работы.
Общая таблица лидеров не может ответить на этот вопрос. Ваша команда может заботиться об извлечении полей из счетов, объяснении кода, написании ответов в службу поддержки, поиске цитат или создании учебных заметок. Каждая задача имеет разные режимы отказа, и лучшая модель для одной задачи может оказаться неправильным выбором для другой.
В этом руководстве создается небольшой воспроизводимый тест Python, который сравнивает кандидатов по четырем практическим параметрам:
качество ответа на конкретную задачу;
задержка;
согласованность при повторных запусках; и
ориентировочная стоимость использования.
В программе используется только стандартная библиотека Python. Вы подключаете каждого кандидата через крошечный адаптер, запускаете одни и те же случаи несколько раз и экспортируете как подробный JSON, так и сводный CSV.
Зачем создавать собственный тест искусственного интеллекта?
Публичные тесты полезны для выявления кандидатов, но обычно они измеряют широкие возможности в контролируемых условиях. Производственные решения уже.
Например, команде, выбирающей помощника по исследованию ИИ, могут потребоваться ответы с интерактивными источниками. Команда кодировщиков может ценить правильные исправления и низкую задержку. Школьная мама