DeepSeek Harness выпустил крупное обновление после бета-тестирования с поддержкой мультимодальности и подагентов
Подробнее
Pandaily
pandaily.com

DeepSeek Harness выпустил крупное обновление после бета-тестирования с поддержкой мультимодальности и подагентов

DeepSeek Harness представил свое первое значительное обновление после завершения публичного бета-тестирования — версию v0.1.0-rc.8. Основным нововведением стало внедрение мультимодальных возможностей. Обновление включает 14 изменений, затрагивающих обработку мультимодального ввода, взаимодействие подагентов, пользовательский опыт в терминале, вызов инструментов и поддержку разработчиков.

Теперь система поддерживает прямой прием изображений и смешанный ввод текста и изображений, при этом команды /goal и /plan могут получать изображения напрямую. Были интегрированы Claude Code и Codex в систему подагентов, улучшен терминал Windows, а также исправлены проблемы, связанные с запросами изображений, потоковой передачей данных и пользовательскими шлюзами.

DeepSeek Harness начал свою публичную бета-версию и открытый исходный код 13 августа. В ночь бета-тестирования Zhidx загрузил исходный код и провел тестирование, переведя 88-страничный документ и разработав игру Snake. Менее чем за неделю агентская платформа приобрела мультимодальные функции.

Разработчики в разных регионах отреагировали на это по-разному: отечественные разработчики выразили энтузиазм, в то время как зарубежные сосредоточились на двух новых функциях, которые были восприняты как явный прогресс. Более интересным стало обнаружение некоторыми разработчиками подхода DeepSeek Harness: для моделей, которые изначально не поддерживают ввод изображений, Harness использует инструменты OCR, статистики цвета и сканирования пикселей для преобразования изображений в структурированную информацию перед передачей ее текстовым моделям для анализа. Таким образом, создается слоистый механизм зрения для чисто текстовых моделей.

Адаптеры моделей DeepSeek теперь позволяют активировать нативный прием изображений через конфигурацию. Для моделей, обладающих функциями зрения, Harness отправляет изображения непосредственно, а /goal и /plan поддерживают смешанный ввод. Меню @ в поле ввода позволяет ссылаться на файлы и сессии, давая пользователям возможность включать локальные файлы и существующие сессии в задачу, что позволяет рабочим процессам агентов учитывать скриншоты.

Система подагентов была расширена: новая версия позволяет по требованию устанавливать Claude Code и Codex в виде пакетов профиля. Codex поддерживает режим разрешений без интерактивного взаимодействия и может иметь несколько именованных экземпляров. Пользователи Windows получили постоянные сессии PowerShell в терминале PTY, которые включены по умолчанию в минимальном режиме. Кроме того, обновление устраняет ошибки, связанные с изображениями слишком большого размера или накопленной историей, неудачными запросами, прерванной потоковой передачей, потерявшей префиксы ответа, а также с пользовательскими шлюзами, совместимыми с OpenAI, которые давали сбой из-за различий в формате запроса.

Разработчик Yinsen обнаружил, что если модель не объявляет поддержку ввода изображений, прямой вызов read_image сначала завершается ошибкой, однако задача не останавливается. Harness переходит на резервный вариант, используя распознавание текста OCR, статистику соотношения цветов и частичное сканирование строк пикселей, считывая размеры изображения и метаданные цветового режима. Изображение, содержащее текст и простые графические элементы, может быть разбито на текстовое содержимое, соотношение цвета фона, изменения пикселей и размер; полученные результаты передаются текстовой модели, которая выводит общее представление об изображении на основе текста OCR и позиций пикселей. Для скриншотов презентаций, блок-схем и интерфейсов с четкой структурой, комбинация OCR и признаков пикселей восстанавливает полезную информацию; при этом реальные фотографии восстанавливают меньше данных. Функциональность зрения не привязана исключительно к базовой модели. Сообщество уже создало плагины для зрения, такие как dsh-vision, dsh-vision-toolkit, modlens, dsh-auto-vision, dsh-subagent-vision и pi-vision через pi2dsh. С релизом rc.8 нативная мультимодальность и эти схемы на основе инструментов работают совместно.

Похожие сюжеты

DeepSeek открыл исходный код DeepSeek Harness: платформа для агентов, основанная на плагинах
Подробнее
pandaily.com

DeepSeek открыл исходный код DeepSeek Harness: платформа для агентов, основанная на плагинах

13 августа вечером DeepSeek сделал своим проектом открытым DeepSeek Harness, чей командный интерфейс обозначается как dsh. В течение нескольких дней количество звезд проекта на GitHub превысило 140 000. Хотя многие интуитивно сравнивают его с версией Claude Code от DeepSeek, документация по архитектуре и исходный код указывают на иное: цель Harness — стать базовой платформой для эры агентов, а не готовым продуктом. Основной принцип работы — все является плагином. Модель выполняет мысли, а Harness управляет этими мыслями в контролируемой среде. Формула взаимодействия выглядит так: Модель + Harness = Агент.

То, что было выпущено, представляет собой не модель и не робота для написания кода. Основа dsh — это Cordis, микроядро, которое занимается исключительно загрузкой, выгрузкой плагинов и управлением зависимостями, не обладая собственной агентской функциональностью, подобно базовой пластине Lego, которая лишь предоставляет разъемы. Адаптеры моделей, реестры инструментов, песочницы, логика планирования и даже веб-интерфейс являются плагинами равного статуса.

Ключевое отличие заключается в том, что агент рассматривается как стык интерфейсов, а цикл агента — как одна конкретная реализация. Плагины зависят только от словарного запаса агента, а не от цикла агента, что позволяет заменить весь оркестрационный цикл путем изменения конфигурационного файла Cordis.

Некоторые аспекты dsh могут показаться знакомыми: основной цикл не кардинально отличается от циклов Claude Code, Codex или WorkBuddy. Все они используют привычный паттерн ReAct: один шаг мышления, вызов инструмента, просмотр результата, повторное мышление до завершения. Разница кроется не в внешнем виде цикла, а в том, как вокруг него собираются компоненты. Claude Code интегрирует их в законченный продукт, Codex запускает цикл внутри своей песочницы, тогда как dsh ничего не объединяет.

Добавления, которые предлагает dsh, включают композицию через конфигурацию, где один файл cordis.yml собирает стандартные, минимальные, PTC и креативные режимы; нейтральность к моделям, позволяющую обмениваться почти 40 моделями благодаря адаптерам; а также возможность встраивания, предоставляемую Python SDK, который делает агентов доступными через JSON-RPC.

Однако проект имеет свои недостатки: это предварительный просмотр для разработчиков с внесением изменений, неидеальный пользовательский опыт и молодая экосистема. Стратегическое решение, принятое командой, является наиболее впечатляющим. Возможности моделей и агентов далеки от схождения; протокол инструментов или правильный цикл сегодняшнего дня могут быть опровергнуты завтра. Способность отключить ответ и заменить его имеет большее значение, чем правильный выбор прямо сейчас. Команда DeepSeek невелика и не может самостоятельно исследовать возможности памяти, планирования, песочниц и мультиагентных систем; открывая Harness как маркетплейс плагинов, они передают эту исследовательскую задачу всему миру.

Лидер проекта Цюй Тяньи заявил, что закрытый исходный код дает настоящее, а открытый исходный код позволяет пользователям освоить будущее. Количество сообществом плагинов с тегом dsh-plugin уже достигло почти 300. Если этот путь окажется успешным, dsh станет инфраструктурой эры агентов, подобно npm для Node или Kubernetes для контейнеров. Несмотря на то, что он пока сырой, его стоит отслеживать: пока все соревнуются в том, чей агент умнее, DeepSeek тихо конкурирует по более фундаментальному вопросу — какие стандартные части должны составлять агентов.

Популярное