Модель Qwen3.8-27B устанавливает новый стандарт производительности для локального запуска на потребительском оборудовании
Подробнее
Pandaily
pandaily.com

Модель Qwen3.8-27B устанавливает новый стандарт производительности для локального запуска на потребительском оборудовании

Разработчики, занимающиеся открытыми моделями, часто создают мемы, и одним из популярных концептов последних месяцев является «kill line» — игровой термин, обозначающий момент, когда матч фактически завершен. Применительно к моделям, этот термин ранее использовался для описания DeepSeek: новая модель сравнивалась с DeepSeek по возможностям и цене; если производительность не соответствовала, а цена не снижалась, модель считалась не имеющей дискуссионной ценности. Однако эта граница сейчас меняется.

14 августа была выпущена Qwen3.8-27B, которая всего за два дня набрала миллион загрузок и возглавила глобальный список трендов на Hugging Face. Среди разработчиков кодового агента Cline она стала самой востребованной локальной моделью за четыре дня. Artificial Analysis присвоила ей оценку 52, ту же, что и GPT-5.6 Luna и DeepSeek V4 Flash, и разработчики окрестили ее локальным Opus 4.6. Эта модель постоянно развивается и особенно хорошо справляется с рассуждениями, генерируя значительно больше токенов рассуждений, чем ее конкуренты. Саймон Уиллисон обнаружил, что по умолчанию ее уровень потребовал 21 минуту для создания изображения пеликана на велосипеде в формате SVG.

При этом важно понимать, что модель имеет всего 27 миллиардов параметров. Возможности, которые еще несколько месяцев назад требовали сотни миллиардов, теперь умещаются в размере, который способен вместить потребительское оборудование. После квантизации в 4 бита веса уменьшаются примерно до 17 ГБ, что доступно для видеокарты с 24 ГБ или устройства Apple Silicon с большим объемом памяти. Старая дилемма заключалась в том, что либо работающая модель была недостаточно умной, либо достаточно умная модель не могла запуститься; Qwen3.8-27B позволяет этим двум условиям совпасть при практичном размере.

Любая новая модель теперь будет оцениваться по сравнению с Qwen3.8-27B. Предыдущая «kill line» DeepSeek основывалась на соотношении цены и производительности, но это все еще требовало облачных ресурсов. Кодовый агент может потреблять сотни тысяч токенов, и в середине августа DeepSeek повысила свою цену, установив максимальную стоимость вывода V4-Pro с 6 до 27 юаней за миллион токенов. Последние два года были посвящены вопросу: чьи токены дешевле при одинаковом уровне интеллекта? Qwen3.8-27B идет дальше, задавая вопрос: насколько большой должна быть модель? Модель размером 27 миллиардов параметров, выполняющая большую часть работы фронтир-модели, меняет физические границы развертывания.

Этот прорыв также имеет технические корни. Промышленный путь снижения затрат долгое время был основан на MoE (Mixture of Experts), который увеличивает емкость, активируя лишь часть экспертов. Однако у MoE есть проблема, незаметная в облаке, но болезненная на устройствах: неактивные эксперты все равно существуют, поэтому общие веса должны храниться. Таким образом, MoE подходит для центров обработки данных, тогда как ПК, роботы и периферийные устройства беспокоятся о том, поместится ли модель вообще. Qwen3.8-27B является плотной моделью, поэтому эффективность достигается за счет архитектуры: она использует гибридный подход с 48 из 64 слоев, применяя линейное внимание и полное внимание к остальным, благодаря чему кеш KV с длинным контекстом не расширяется пропорционально длине последовательности.

Популярное