Система Floatboat от китайской команды превзошла Claude Opus 4.8 на пяти тестах, используя самую дешевую модель
Подробнее
Pandaily
pandaily.com

Система Floatboat от китайской команды превзошла Claude Opus 4.8 на пяти тестах, используя самую дешевую модель

Китайская команда AOE Tech Labs, разработавшая продукт агентского рабочего стола Floatboat, опубликовала полные данные оценки Harness по пяти сторонним бенчмаркам агентов 7 августа. В качестве базовой модели использовалась DeepSeek-V4-Flash, которая является самой доступной достоверной моделью на рынке. При сохранении модели и стоимости изменялся только исполняющий Harness. Модель, которая ранее показывала результаты ниже Claude Opus 4.8 на всех пяти бенчмарках в собственном Harness DeepSeek, смогла превзойти Opus 4.8 во внутреннем Harness Floatboat.

Результат становится еще более значимым, учитывая ценообразование. Opus 4.8 стоит 5 долларов за миллион входных токенов и 25 долларов за миллион выходных. При соотношении ввода к выводу 3:1, часто встречающемся в сценариях работы агентов, комбинированная стоимость Floatboat составляет всего 0,175 доллара за миллион токенов, тогда как у Opus 4.8 — 10 долларов, что представляет собой разрыв в 57,1 раза. Эти пять бенчмарков представляют собой публичные рейтинги лидеров от третьих сторон, включая BrowseComp, созданный OpenAI. Данные не являются артефактом выбора вопросов.

Методология исследования была проведена максимально строго. В контрольной группе использовалась официальная версия DeepSeek-V4-Flash-0731, а не предварительный контрольный пункт. Контрольная группа работала в собственном Harness провайдера в минималистичном режиме, что делает сравнение более жестким, поскольку инженеры провайдера участвовали в процессе. Сторона Floatboat работала в изолированных физических песочницах с идентичными параметрами ввода. Единственной переменной был сам Harness.

При сортировке задач по горизонту выполнения от короткого к длинному, прирост производительности не уменьшается: 1,9 процента, 9,6 процента, 12,6 процента, 19,9 процента и 23,6 процента. Короткие задачи по сути являются вопросно-ответными сессиями с одним запросом, где качество модели играет решающую роль. Задачи с длинным горизонтом, которые отражают реальную работу, зависят от системы исполнения: доступа к файлам, обращений к инструментам, сохранения состояния, многошаговой самокоррекции и отката. Реальная работа происходит на конце длинного горизонта.

AOE Tech Labs ввела Коэффициент рычага Harness, или HLR, чтобы сделать сравнение проверяемым. Формула расчета — это прирост, полученный только за счет изменения Harness, разделенный на прирост, полученный при обновлении до более сильной эталонной модели. Значение HLR больше единицы означает, что сам Harness превосходит обновление модели. На DeepSWE Floatboat сообщил об HLR в 3,57: сохраняя модель неизменной и меняя только Harness, было достигнуто в 3,57 раза большее публичное представление производительности, чем при обновлении до Opus 4.8. По всем пяти бенчмаркам HLR монотонно возрастал с увеличением длины горизонта от 0,78 до 3,57.

AOE Tech Labs была основана в конце 2025 года при участии инвесторов HSG и VLight Capital в раунде посевного финансирования. Команда выпустила Floatboat Desktop в январе, FloatIM в апреле и FloatSchedule в мае. Основная идея заключается в том, что система, непрерывно сокращающая разрыв между развивающейся целевой системой исполнения и дрейфующим выводом модели, является ключом к агентам повседневного использования. Самая дешевая модель теперь способна соответствовать или превосходить самую дорогую передовую модель, когда Harness спроектирован для работы с длинным горизонтом.

Похожие сюжеты

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке
Подробнее
pandaily.com

Локальная модель StartLux с 27 млрд параметров превзошла DeepSeek V4 Flash в китайском AI-бенчмарке

Согласно отчету, подготовленному Китайской академией информационных и коммуникационных технологий (CAICT), на карте локальных моделей появился новый игрок. Компания StartLux, базирующаяся в Шанхае и разработавшая модель StartLux-V1.0-27B-Preview, заняла второе место в общем зачете специального теста MCP в рамках линейки проверенных AI-бенчмарков, опередив DeepSeek-V4-Flash, используя всего 27 миллиардов параметров.

Тест MCP оценивает шесть специализированных задач: навигацию по местоположению, поиск в интернете, автоматизацию браузера, финансовый анализ, управление репозиториями кода и 3D-дизайн, а также включает комплексную оценку, фокусирующуюся на координации нескольких инструментов, выполнении сложных задач и взаимодействии в реальных условиях. Среди протестированных моделей были DeepSeek-V4-Pro (1,6 триллиона параметров), DeepSeek-V4-Flash-0731 (284 миллиарда), Step-3.7-Flash (198 миллиардов), StartLux-27B-260715 (27 миллиардов), Qwen-3.6-27B (27 миллиардов) и AgentCPM-Explore (4 миллиарда).

Модель StartLux-V1.0-27B-Preview получила балл 39.25, что обеспечило ей второе место, обойдя как DeepSeek-V4-Flash с 284 миллиардами параметров, так и Step-3.7-Flash с 198 миллиардами. При одинаковом размере параметров она опередила Qwen-3.6-27B на 5.34 пункта. Модель заняла первое место в навигации по местоположению, а также показала первое место или сравнялась с ним в автоматизации браузера и финансовом анализе, в некоторых случаях достигая уровня триллионной модели DeepSeek-V4-Pro.

Данная модель построена на основе Qwen3.6-27B с дополнительным улучшением после обучения. StartLux внедрила подход, который они назвали «AI обучает AI» (Автоматический поиск), позволяющий автономно проводить экспериментальные тренировки и совершенствовать стратегию посредством обратной связи. Компания утверждает, что это первое применение данного метода для локальной агентной модели в Китае.

Этот результат отражает более широкий сдвиг в индустрии. Поскольку производительность передовых моделей достигла практических пороговых значений, эра гонки параметров трансформировалась в фазу гомогенизации; приоритеты пользователей все чаще смещаются в сторону решения реальных проблем, обеспечения безопасности данных и контроля затрат, а не только достижения высоких показателей в бенчмарках. Мировые игроки движутся в том же направлении: Google's Gemma 4, Meta's open Muse Glimmer и Nvidia's Nemotron 3.5 Lightning нацелены на локальное развертывание.

StartLux-V1.0-27B-Preview может работать на потребительских ПК, и компания планирует выпустить свое первое поколение решений локального интеллекта в текущем году. Результаты CAICT сигнализируют предприятиям о том, что компактные, локально развертываемые модели теперь способны конкурировать с гораздо более крупными облачными решениями в задачах, имеющих значение в реальных рабочих процессах, что начинает менять решения о закупках.

DeepSeek выпустила ИИ с компьютерным зрением, способным выполнять задачи автономно
Подробнее
olhardigital.com.br

DeepSeek выпустила ИИ с компьютерным зрением, способным выполнять задачи автономно

DeepSeek представила DeepSeek-V4-Flash-Vision-Exp в эту пятницу, 21-го числа. Эта новая экспериментальная модель искусственного интеллекта не ограничивается обработкой текста; она также обладает способностью читать, интерпретировать и понимать изображения.

По данным китайской компании, производительность этой новой модели приближается к Opus 4.8, разработанному американским конкурентом Anthropic. ИИ от DeepSeek теперь может анализировать фотографии, снимки экрана и документы для выполнения задач без необходимости предоставления пользователем подробных инструкций для каждого этапа.

Разработчики могут интегрировать эту функцию в свои собственные проекты. Модель сохраняет все текстовые функции своей предыдущей версии, DeepSeek-V4-Flash, включая логическое рассуждение, общие знания и способность выполнять автоматизированные рутинные операции. Основное отличие заключается в том, что система начинает одновременно обрабатывать визуальные и текстовые данные.

В оценках производительности, сфокусированных на автономных задачах, известных как агенты, китайская модель достигла результатов, сопоставимых с Opus 4.8 от Anthropic. Эта особенность позволяет инструменту просматривать изображение, понимать контекст, представленный на экране, и самостоятельно принимать решения для завершения требуемой работы.

Программисты могут протестировать эту новинку через платформу DeepSeek, введя название новой модели в код доступа. Отправка изображений в систему может осуществляться через интернет-ссылки, файловые коды или с использованием нового собственного механизма отправки компании.

В дополнение к визуальной модели DeepSeek бесплатно предоставила инструмент управления файлами под названием Files API. Этот ресурс позволяет пользователю загрузить изображение на серверы только один раз и повторно использовать его в различных последующих вызовах API, оптимизируя потребление трафика и ускоряя ответы.

Этот запуск усиливает конкуренцию между технологическими компаниями Китая и США. Стратегия, принятая китайскими компаниями, сосредоточена на предложении решений с более низкими операционными затратами, сохраняя при этом конкурентоспособность, близкую к более дорогим американским моделям.

Популярное