В Ollama v0.32.6-rc0 добавлен полезный путь для людей, использующих Qwen3.5 на графических процессорах Apple: движок MLX теперь автоматически использует головку MTP модели для спекулятивного декодирования. Практическая идея проста. Глава MTP прогнозирует предстоящий токен...
В Ollama v0.32.6-rc0 добавлен полезный путь для людей, использующих Qwen3.5 на графических процессорах Apple: движок MLX теперь автоматически использует головку MTP модели для спекулятивного декодирования.
Практическая идея проста. Глава MTP прогнозирует появление токенов, а основная модель проверяет эти прогнозы в пакетном режиме. Принятые прогнозы могут уменьшить последовательное ожидание во время декодирования.
Оллама говорит, что это делает Qwen3.5 быстрее. В примечаниях к выпуску не публикуются результаты тестов, тестовая машина или процент ускорения, поэтому такие утверждения, как «в 2 раза быстрее», в этом выпуске не поддерживаются.
Изменение совместимости может иметь не меньшее значение.
В том же выпуске изменено поведение потоковой передачи для OpenAI-совместимой конечной точки /v1/chat/completions.
Если ваш клиент анализирует фрагменты, данные об использовании или Finish_reason, повторно запустите его тесты совместимости, прежде чем включать RC в производственный рабочий процесс. Локальный вывод становится легче применять, когда поведение его проводов предсказуемо, а не только тогда, когда генерация токенов происходит быстрее.
Две причины протестировать перед обновлением
Во-первых, это кандидат на выпуск, а не стабильная версия.
Во-вторых, экспериментальная генерация изображений была временно удалена. Оллама рекомендует оставаться на версии 0.32.5, если эта функция является частью