Bilibili выпустила семейство моделей машинного перевода Index-Translate на базе Qwen3.5 для 150 языков
Подробнее
Pandaily
pandaily.com

Bilibili выпустила семейство моделей машинного перевода Index-Translate на базе Qwen3.5 для 150 языков

Команда Index LLM компании Bilibili представила Index-Translate — семейство многоязычных моделей перевода, разработанных на основе Qwen3.5 от Alibaba. Эти текстовые модели поддерживают 150 языков, включая китайский и английский, и доступны под лицензией Apache-2.0 на платформах Hugging Face и ModelScope. Они выпускаются в размерах 2B, 9B и 35B-A3B (предварительная версия), а также сопровождаются техническим отчетом, кодом на GitHub и онлайн-демонстрацией.

Функциональность моделей выходит за рамки простого перевода; они способны следовать инструкциям относительно терминологии, форматирования и сохранения неизменным контента. Например, в одном примере модель 9B перевела уведомление об обслуживании игры в формате JSON на корейский язык, сохранив при этом его структуру, звездочки и хештег, которые пользователь просил сохранить.

Семейство моделей расширяется тремя специализированными ветвями. Index-Echo генерирует переведенные субтитры или озвучку, сохраняя при этом характеристики голоса исходного диктора. Его пакетный релиз преобразования речи в речь охватывает переводы с китайского на английский, испанский и японский, а также с английского на китайский, испанский и японский. Модель Index-Homura настраивает перевод с учетом целевого количества слогов, что критично для дубляжа и субтитров. А Index-NativeLong, доступный под идентификаторами Index-Nailong, занимается переводом целых документов, обеспечивая согласованность ссылок между ними.

Примеры, представленные Bilibili, основаны на контенте собственного сообщества. Когда модель 9B обрабатывала сленговое выражение геймера о желании поиграть в Final Fantasy XIV, она перевела его как «When the FFXIV itch hits, just go play.». В фантастическом тексте объемом около 32 000 токенов, где имя персонажа могло быть истолковано как королевский титул, модель для длинных документов сохранила это имя последовательно, тогда как та же модель 9B, работая по частям, допускала другие варианты перевода.

Согласно внутренним бенчмаркам команды, предварительная версия 35B-A3B показала результат 0.8794 на FLORES (COMET-22) и 76.76 по оценке судьи WMT26. Модель 9B достигла показателей 0.8789 и 75.35. Стоит отметить, что некоторые крупные общие модели демонстрируют более высокие результаты на WMT26, включая DeepSeek-V4.1-Flash с результатом 83.55. При работе с низкоресурсными задачами следования инструкциям модель 9B показала наилучший балл по инструкциям — 0.7725 — и самый низкий показатель отклонения от цели — 3.47% среди всех сравниваемых моделей. Модель Index-Homura-9B в 81.92% случаев попадает в заданное количество слогов в пределах 10% согласно тесту SandGlass команды.

Команда также разработала собственные бенчмарки для контроля следования инструкциям, игрового сленга и управления слогами. Репозиторий включает расширение для браузера, позволяющее переводить веб-страницы с использованием локально развернутой модели, а также конвейер для дубляжа видео. Bilibili планирует выпустить официальную модель 35B-A3B, сделать свои бенчмарки открытыми, добавить языки в Index-Echo и опубликовать более крупные модели.

Популярное