Два больших открытых релиза сейчас у всех в ленте — это Kimi K3 (2,8 триллиона параметров, первая открытая модель 3T-класса) и Ling 3.0 Flash от InclusionAI компании Ant Group. Только один из них может жить на оборудовании, принадлежащем человеку, и это не так...
Два больших открытых релиза сейчас у всех в ленте — это Kimi K3 (2,8 триллиона параметров, первая открытая модель 3T-класса) и Ling 3.0 Flash от InclusionAI компании Ant Group. Только один из них может работать на оборудовании, которым владеет человек, и это не тот, у которого самый большой заголовок. Вот практическая картина локального запуска Ling 3.0 Flash с измеренными размерами файлов вместо прогнозов, а также честные математические расчеты того, почему K3 остается в облаке.
Форма модели решает все
Ling 3.0 Flash — это смесь экспертов с 124 миллиардами параметров, которая активирует только 5,1 миллиарда параметров на каждый токен (8 из 512 перенаправленных экспертов плюс один общий). Как и в любом MoE, общие параметры определяют ваш расход памяти, а активные параметры определяют вашу скорость. 124 байт данных на счетчике памяти, 5,1 байт вычислений на счетчике скорости: именно эта комбинация работает в интерактивном режиме на машинах, которые могут пролезть под плотным 70 байтами.
Еще два замечания по архитектуре, которые имеют значение на практике. Он использует гибридное линейное внимание (35 слоев внимания Кими-дельта, чередующихся с 7 закрытыми слоями MLA), поэтому длинные контексты развивают память мягко, а не квадратично. И это нативный гибридный мыслитель: по умолчанию он думает, прежде чем ответить, и