IQuest Research открыла для общественности модель IQuest-Q1, которая представляет собой разреженную языковую модель типа 'mixture-of-experts' (MoE), разработанную для задач кодирования, рассуждений и многоэтапного использования инструментов в рамках работы агентов. Общий объем параметров модели составляет около 320 миллиардов, при этом на каждый токен активируется примерно 15 миллиардов параметров.
Веса и карточка модели были опубликованы на платформе Hugging Face в организации IQuestLab 28 сентября, а код для инференса доступен на GitHub под специальной лицензией IQuest-Q1. Команда позиционирует IQuest-Q1 как фундаментальную модель для систем командной строки агентов.
Технические характеристики и обучение
Согласно карточке модели, IQuest-Q1 имеет 88 слоев трансформера, 256 экспертов, из которых восемь активируются на токен. Модель использует гибридный паттерн внимания, сочетающий три слоя со скользящим окном и один слой с полным вниманием, а также поддерживает контекстное окно размером 524 288 токенов. Для многотокеновой предсказания предусмотрены слои, поддерживающие спекулятивное декодирование.
IQuest рекомендует использовать модель с SGLang или vLLM на восьми графических процессорах (GPU) и запускать ее внутри таких сред, как Claude Code или Codex. Процесс предварительного и промежуточного обучения включал смещение данных в сторону кода и STEM-дисциплин, а также добавление траекторий агентов с более длинным контекстом, после чего последовало три этапа, ориентированных на работу агентов.
IQuest синтезировала задачи вместе с их средами, включая реальные API, серверы MCP и исполняемые репозитории, обучив одну политику на множестве сред. Методы обучения с подкреплением позволили создать четыре экспертные модели для различных сценариев — пользовательского опыта агента, работы в нескольких средах, задач с большим горизонтом и общей работы агента. Эти модели затем были объединены в единого студента посредством многоучительской дистилляции по политике.
Результаты тестирования
При тестировании на опубликованных бенчмарках IQuest-Q1 продемонстрировала следующие результаты: 64.6 на DeepSWE v1.1, 63.0 на NL2Repo, 84.5 на CyberGym, 83.2 на Terminal-Bench 2.1, 55.7 на JobBench и 29.6 на Agents' Last Exam. Сравнительная таблица показывает, что модель превосходит GLM-5.3 и DeepSeek-V4-Pro на NL2Repo, однако уступает DeepSeek-V4.1-Flash на тестах DeepSWE и CyberGym. Результаты других моделей представлены публично, где это возможно.
IQuest также подчеркнула, что модель проходила разработку под человеческим контролем. В одном случае, описанном в блоге IQuest, IQuest-Q1, работающая в Claude Code, обнаружила, что замедление кривой вознаграждения было вызвано лишним пробелом, введенным при декодировании текста, что привело к тому, что в функции потерь обучения остался только последний ход многоходовых траекторий. После устранения этой ошибки среднее вознаграждение восстановилось. Исследователи сохраняли контроль над направлением исследований, дорогостоящими экспериментами и выбором версий для внедрения. Команда предупреждает, что модель является текстовой, находится на ранней стадии и требует постоянного контроля человека при выполнении реальных задач в командной строке.


