DeepSeek Harness представил свое первое значительное обновление после завершения публичного бета-тестирования — версию v0.1.0-rc.8. Основным нововведением стало внедрение мультимодальных возможностей. Обновление включает 14 изменений, затрагивающих обработку мультимодального ввода, взаимодействие подагентов, пользовательский опыт в терминале, вызов инструментов и поддержку разработчиков.
Теперь система поддерживает прямой прием изображений и смешанный ввод текста и изображений, при этом команды /goal и /plan могут получать изображения напрямую. Были интегрированы Claude Code и Codex в систему подагентов, улучшен терминал Windows, а также исправлены проблемы, связанные с запросами изображений, потоковой передачей данных и пользовательскими шлюзами.
DeepSeek Harness начал свою публичную бета-версию и открытый исходный код 13 августа. В ночь бета-тестирования Zhidx загрузил исходный код и провел тестирование, переведя 88-страничный документ и разработав игру Snake. Менее чем за неделю агентская платформа приобрела мультимодальные функции.
Разработчики в разных регионах отреагировали на это по-разному: отечественные разработчики выразили энтузиазм, в то время как зарубежные сосредоточились на двух новых функциях, которые были восприняты как явный прогресс. Более интересным стало обнаружение некоторыми разработчиками подхода DeepSeek Harness: для моделей, которые изначально не поддерживают ввод изображений, Harness использует инструменты OCR, статистики цвета и сканирования пикселей для преобразования изображений в структурированную информацию перед передачей ее текстовым моделям для анализа. Таким образом, создается слоистый механизм зрения для чисто текстовых моделей.
Адаптеры моделей DeepSeek теперь позволяют активировать нативный прием изображений через конфигурацию. Для моделей, обладающих функциями зрения, Harness отправляет изображения непосредственно, а /goal и /plan поддерживают смешанный ввод. Меню @ в поле ввода позволяет ссылаться на файлы и сессии, давая пользователям возможность включать локальные файлы и существующие сессии в задачу, что позволяет рабочим процессам агентов учитывать скриншоты.
Система подагентов была расширена: новая версия позволяет по требованию устанавливать Claude Code и Codex в виде пакетов профиля. Codex поддерживает режим разрешений без интерактивного взаимодействия и может иметь несколько именованных экземпляров. Пользователи Windows получили постоянные сессии PowerShell в терминале PTY, которые включены по умолчанию в минимальном режиме. Кроме того, обновление устраняет ошибки, связанные с изображениями слишком большого размера или накопленной историей, неудачными запросами, прерванной потоковой передачей, потерявшей префиксы ответа, а также с пользовательскими шлюзами, совместимыми с OpenAI, которые давали сбой из-за различий в формате запроса.
Разработчик Yinsen обнаружил, что если модель не объявляет поддержку ввода изображений, прямой вызов read_image сначала завершается ошибкой, однако задача не останавливается. Harness переходит на резервный вариант, используя распознавание текста OCR, статистику соотношения цветов и частичное сканирование строк пикселей, считывая размеры изображения и метаданные цветового режима. Изображение, содержащее текст и простые графические элементы, может быть разбито на текстовое содержимое, соотношение цвета фона, изменения пикселей и размер; полученные результаты передаются текстовой модели, которая выводит общее представление об изображении на основе текста OCR и позиций пикселей. Для скриншотов презентаций, блок-схем и интерфейсов с четкой структурой, комбинация OCR и признаков пикселей восстанавливает полезную информацию; при этом реальные фотографии восстанавливают меньше данных. Функциональность зрения не привязана исключительно к базовой модели. Сообщество уже создало плагины для зрения, такие как dsh-vision, dsh-vision-toolkit, modlens, dsh-auto-vision, dsh-subagent-vision и pi-vision через pi2dsh. С релизом rc.8 нативная мультимодальность и эти схемы на основе инструментов работают совместно.

