Команда Alibaba представила модель Qwen3.8-27B с открытым исходным кодом. За два дня модель возглавила глобальный тренд на платформе Hugging Face и превысила миллион загрузок, включая версию FP8; квантованная версия Unsloth приблизилась к трем миллионам. Разработчики, проводившие тестирование, окрестили ее «локальным Опусом 4.6», поскольку эта модель с параметрами менее 30 миллиардов превосходит все модели, выпущенные четыре месяца назад, включая Opus 4.6, которая сравнивалась с DeepSeek V4-Pro и GPT 5.6 Luna, став первой локальной моделью, достигшей уровня передовых разработок. В квантованном виде она функционирует при использовании 17 ГБ оперативной памяти.
Модель является нативно мультимодальной плотной моделью, способной понимать изображения и видео. Она обладает нативным контекстом в 262K, который расширяется до 1 миллиона, и распространяется под лицензией Apache 2.0, что позволяет использовать ее в коммерческих целях.
При оценке навыков кодирования и работы агентов, Qwen3.8-27B показала результат SWE-bench Pro в 61.7 против 53.4 у Opus 4.6 Max. В тесте DeepSWE 1.1 она набрала 42.2, что примерно в три раза выше показателя ее предшественника в 13.3. Результаты в задачах офисной работы и работы агентов также высоки: CoWorkBench показал 70.7 по сравнению с 68.2 у Opus 4.6 Max, а JobBench — 33.4. Показатель Pass@1 для экзаменов агентов составил 20.4, почти вдвое больше, чем у предыдущей версии (10.6). Кроме того, IFBench получил 79.5, а LiveCodeBench v6 — 90.3, что является наивысшим показателем в таблице.
Мультимодальность реализована нативно в архитектуре, позволяя обрабатывать изображения и видео, начиная от графиков STEM и заканчивая часовыми видео. При проверке компьютерных операций по стандарту OSWorld, модель набрала 84.3, что на 11.6 пункта выше, чем у Opus 4.6 Max. Операции с телефоном по AndroidWorld оцениваются в 81.9, а браузерные операции, проверенные WebArena, достигли 64.8, что на 9.5 пункта выше, чем у ее предшественника. В области визуального рассуждения без использования инструментов, MathVision показала 90.0 против 65.5, BabyVision — 65.7 против 12.6, а анализ графиков CharXiv — 83.7 против 66.0. Сочетание способности читать скриншоты, нажимать кнопки, заполнять формы, управлять браузерами и телефонами, а также кодировочных навыков формирует полный цикл агента для выполнения компьютерных операций.
Размер 27B является наиболее востребованным сообществом, так как он позволяет разместить модель на ноутбуках после квантования с использованием потребительских графических процессоров. Версия Unsloth работает при 17 ГБ оперативной памяти, а сжатие Atomic Dynamic GGUF снижает объем с 28.9 ГБ при 8-битном формате до 8.5 ГБ при 1-битном. В тот же день появились такие инструменты, как SGLang, Ollama и vLLM. Разработчики отмечают удивительную возможность наличия неограниченных, бесплатных сверхинтеллектуальных устройств прямо на рабочих столах: при наличии только RTX 5090 можно получить интеллект, эквивалентный Opus 4.8. Саймон Уиллисон поделился, что давно не испытывал такого удовольствия от работы с локальной моделью. Он отметил, что режим мышления по умолчанию включен и может быть отключен по запросу, а настройка глубины рассуждений (reasoning_effort) позволяет регулировать этот процесс; Уиллисон обнаружил, что значение xhigh заставляет модель думать слишком много, и посоветовал начинать с низкого или отсутствующего уровня рассуждений.
Таким образом, Qwen3.8-27B поднимает показатели в кодировании и работе агентов до уровня Opus, предоставляя контроль над весами, глубиной мышления и безопасностью данных.


