Команда Tianxi AI от Lenovo разработала агент для кодирования, который завоевал первое место в рейтинге Lite платформы SWE-bench-Live. Этот бенчмарк требует от систем искусственного интеллекта устранять реальные проблемы, взятые из проектов на GitHub. Агент TianxiCode, использующий DeepSeek-V4.1-Flash в качестве базовой модели, смог решить 71% задач и прошел официальную проверку бенчмарка, как стало известно из заявления Lenovo, распространенного QbitAI 9 октября.
Важно отметить, что этот результат относится исключительно к разделу Lite, а не к полным или многоязычным таблицам рейтинга. Согласно публичному списку лидеров, запись от 8 октября показала решение 213 из 300 задач Lite. Преимущество над следующим проверенным участником в этой же категории составляет всего 0.67 процентных пункта, так как следующий участник находится на уровне 70.33%.
SWE-bench-Live отличается от традиционных тестов на кодирование, которые проверяют синтаксис или отдельные функции. Каждая задача основана на реальном тикете из GitHub, и система должна создать патч, исправляющий проблему в воспроизводимой среде выполнения. Чтобы получить метку «Verified», команды предоставляют полные траектории работы своего агента, после чего организаторы проверяют входные данные оценки и настройку изоляции на предмет утечки эталонных ответов, тестовых примеров или результатов.
Как работает агент TianxiCode
Lenovo описывает распределение функций следующим образом: DeepSeek-V4.1-Flash выполняет роль «мозга инженера», анализируя код и предлагая исправления, в то время как TianxiCode обеспечивает «глаза, руки, инструменты и рабочую дисциплину». Компания подчеркивает три ключевые способности. Многошаговый поиск информации между файлами, в сочетании с отсечением и нарезкой контекста, позволяет агенту отследить первопричину ошибки в крупной кодовой базе. Автономное планирование с многоходовыми вызовами инструментов дает ему возможность составить план отладки, запустить тесты в терминале, прочитать журналы и сравнить историю изменений, а затем изменить подход, если возникнет затруднение.
Закрытый цикл исправления с самокоррекцией на основе тестов позволяет запускать новый код в изолированной среде и продолжать дорабатывать его до тех пор, пока патч не пройдет проверку. TianxiCode является компонентом для генерации кода и разработки программного обеспечения в экосистеме Tianxi AI от Lenovo. Lenovo планирует интегрировать эту работу в цепочки инструментов разработчиков и в свои аппаратные продукты на базе ИИ, однако сроки или конкретные устройства, на которых он будет работать, не были объявлены.
Полученный результат также демонстрирует потенциал экономически эффективной модели класса Flash при сочетании ее с мощным механизмом агента. Lenovo не опубликовала отдельных оценок той же системы на других моделях.
