13 августа вечером компания DeepSeek сделала два важных объявления: официально выпустила DeepSeek V4 Pro, доступный через приложение, веб-интерфейс и API, а также представила первый пост команды DeepSeek Harness с аватаром «черный кит», анонсировавший предварительную версию Harness, которая была выпущена с открытым исходным кодом под лицензией MIT.
Значимость Harness заключается в том, что в эпоху агентов модель перестает быть единственным фактором, определяющим способность искусственного интеллекта выполнять задачи. Ранее, 6 и 11 августа, компания Composio, занимающаяся инструментами для агентов, интегрировала ту же модель DeepSeek V4-Flash в восемь различных систем исполнения (harnesses). Эти системы были запрошены для выполнения 30 многоэтапных задач в реальных приложениях, таких как Gmail, Google Calendar, GitHub и Slack.
Результаты этих тестов показали значительные расхождения: лучшая система прошла 20 задач, тогда как наихудшая справилась с 14. Из общего числа 240 запусков только 129 оказались успешными, и лишь шесть из 30 задач были выполнены всеми восемью системами. С точки зрения затрат, выполнение 16 задач моделями Claude Code, Codex и DeepAgents стоило примерно 0.195, 0.081 и 0.045 доллара за одну успешную задачу соответственно, что демонстрирует четырехкратную разницу в стоимости при использовании одной и той же модели.
Согласно внутренней позиции DeepSeek, агенты должны решать проблему непрерывного обучения, что в конечном итоге позволит ИИ ускорять собственную разработку. Harness позиционируется как рабочая среда, через которую модели входят в реальную разработку. Компания, основанная на низкой стоимости и силе моделей, не может позволить, чтобы выполнение задач и точки входа разработчиков зависели от чужих систем.
Основной принцип проектирования, согласно документации DeepSeek, заключается в том, что все является плагином. Harness построен на системе плагинов Cordis: модели, инструменты, навыки, сессии, песочницы, хранилище, циклы, планирование и пользовательский интерфейс — все это формируется из плагинов. Это отличается от стандартных плагинов: плагины VS Code добавляют функции редактору, а плагины Codex — инструменты агенту, в то время как плагины Harness могут полностью заменить мозг, набор инструментов, правила или внешний вид агента.
Во время внутреннего просмотра разработчики смогли создать сотни плагинов за считанные дни, включая один, который реализовал долгосрочную память между сессиями с фоновой самоэволюцией. Другой ключевой особенностью является возможность отслеживания истории. Harness использует журналы сессий с возможностью добавления записей (append-only session logs): все, что видит модель, системные подсказки, цепочки рассуждений, вызовы инструментов и результаты, планирование под-агентов и каждое внедрение контекста полностью фиксируются, при этом сжатие контекста никогда не удаляет исходную историю. Разработчики могут просматривать историю по источнику в представлении Trajectory с функциями восстановления, форка, извлечения и воспроизведения.
Руководитель команды, Цю Тяньи, имеет степень по компьютерным наукам Университета Чжэцзян и проработал девять лет в фирме количественной торговли Jane Street, прежде чем присоединиться к DeepSeek в марте 2026 года, когда внутренне начался проект Harness. Harness по умолчанию поддерживает почти 40 крупных моделей, включая Kimi, OpenAI, Anthropic и Google, позиционируя себя как набор компонентов, а не готовый агент. Номер версии v0.1 ясно указывает на то, что «черный кит» только появился на поверхность.


