Исследователи из Южной Африки разработали программный инструмент, призванный решить одну из главных проблем, стоящих перед африканскими языками в цифровую эпоху, и теперь он используется учеными по всему миру.
Этот инструмент, получивший название TextAugment, создан для помощи разработчикам в создании языковых технологий, когда у них отсутствует огромное количество цифрового текста, необходимого для обучения систем искусственного интеллекта. Программное обеспечение с открытым исходным кодом было разработано профессором Vukosi Marivate, директором Африканского института науки о данных и ИИ (AfriDSAI) и обладателем кресла Absa UP Chair of Data Science в Университете Претории, а также исследователем Tshephisho Sefara. На данный момент инструмент зарегистрировал более 286 000 загрузок и применяется в работе с такими языками, как суахили, арабский и узбекский.
Распространение этого программного обеспечения было отмечено 16 июля, когда Marivate и команда TextAugment получили первый Награду NSTF-SADiLaR Research Software Award за технологии человеческого языка. Эта награда присуждается за создание программного обеспечения с открытым исходным кодом, которое помогает исследователям генерировать синтетические обучающие данные для языков с недостаточными цифровыми ресурсами.
Признание стало частью серии недавних наград для Marivate. 19 мая компьютерный ученый, родившийся в Га-Ранкуве, получил Орден Мапунгубве Серебра за свой вклад в области науки о данных, искусственного интеллекта и обработки естественного языка. Президентство высоко оценило его работу, отметив «его превосходный вклад в науку о данных, искусственный интеллект (ИИ) и обработку естественного языка (NLP), который значительно продвинул как национальные, так и континентальные технологические возможности».
Однако его деятельность выходит за рамки простого обучения машин пониманию языка. Она ставит более широкий вопрос: что произойдет, если технологии, формирующие будущее, не смогут понять языки, на которых говорят миллионы людей? Он подчеркнул, что «самого существования ИИ недостаточно, чтобы он действительно повлиял на людей»; необходимо создать подходящие условия для усиления положительных моментов и минимизировать негативные последствия любой технологии.
Африканские языки в исследованиях ИИ классифицируются как языки с «низкими ресурсами». По мнению Marivate, это не означает, что таких языков мало говорящих, а скорее то, что им не хватает цифровых данных и инструментов, позволяющих машинам эффективно их обрабатывать. Он объяснил, что «одно из самых больших препятствий при обучении надежных моделей машинного обучения для языков с низкими ресурсами (таких как isiZulu, Sesotho или Yoruba) — это нехватка данных. Традиционные модели ИИ требуют огромного количества чистых, размеченных данных для хорошей работы. Если такие данные отсутствуют, эти языки фактически исключаются из современной революции ИИ».
Проблема данных, которая исключает африканские языки из ИИ
Этот пробел становится особенно очевидным при взаимодействии людей с онлайн-системами. Например, системы анализа настроений могут определять, является ли отзыв в сети положительным, отрицательным или нейтральным. Но системы, разработанные преимущественно для английского языка, не могут автоматически предоставлять такую же услугу для африканских языков.
Marivate отметил: «В Южной Африке у нас 12 официальных языков, и мы на самом деле не обслуживаем большинство наших людей. Чтобы взаимодействовать со всеми этими онлайн-системами, вас вынуждают писать на английском, потому что именно так происходит обработка».
Язык может иметь миллионы носителей, оставаясь при этом слабо представленным в интернете. Именно здесь в игру вступает один из наиболее часто используемых исследовательских инструментов Marivate. TextAugment был создан для того, чтобы помочь исследователям обойти дефицит высококачественных языковых данных. Инструмент работает путем синтетического расширения существующих наборов данных, включая замену слов в предложениях синонимами с попыткой сохранить первоначальный смысл.
Эта технология поддерживает приложения для перевода, анализа настроений, суммаризации и другие задачи обработки языка. Она также помогает исследователям создавать такие инструменты, как проверки орфографии и системы для обработки письменной речи. В конечном итоге TextAugment был выпущен как программное обеспечение с открытым исходным кодом, чтобы исследователи за пределами команды Marivate могли им пользоваться. С тех пор он использовался исследователями, работающими с такими языками, как суахили, узбекский и арабский.
Создание ИИ, который понимает больше, чем просто слова
Однако увеличение объема языковых данных для моделей ИИ — это лишь часть проблемы. Африканские языки несут культурные значения, идиомы и пословицы, которые нельзя всегда перевести дословно. Marivate признает, что некоторые методы аугментации имеют ограничения, поскольку замена слова синонимом не обязательно учитывает контекст, в котором это слово используется.
Он заявил: «Написание на английском и последующий перевод на isiXhosa — это не то же самое, что человек, пишущий на isiXhosa, потому что они пишут так, что затрагивает культуру, географию и многое другое, что находится внутри».
Для Marivate африканские языковые технологии не должны сводиться к тому, чтобы взять англоязычные системы и заставить их выдавать африканские слова. Технология должна быть способна взаимодействовать с культурным контекстом, на котором эти языки используются. Поэтому его исследовательская группа изучает, как модели ИИ понимают идиомы и пословицы в африканских языках, включая isiZulu и Tshivenda.
Проблема выходит за рамки того, как ИИ обрабатывает отдельные слова. Более широкий вопрос о том, чьи языки и знания представлены в ИИ, был также рассмотрен вице-канцлером Университета Ганы, профессором Nana Aba Appiah Amfo, во время Лекции отличия Университета Уоррика 2026 года. В лекции под названием «Чей язык имеет значение? Африканские голоса, системы знаний и будущее ИИ» Амфо исследовала последствия исключения языков в новых технологиях и оспорила общепринятые предположения о том, чьи знания представлены в системах ИИ.
По ее словам, отсутствие африканских языков в цифровых экосистемах — это не просто техническое ограничение, а вопрос репрезентации и включенности. Она заявила: «Когда язык отсутствует в цифровом корпусе, это не просто проблема перевода. Это проблема видимости. Это проблема знаний. И в конечном счете, это вопрос справедливости».
Легко представить развитие ИИ в Африке как нечто, начавшееся с появления ChatGPT. Marivate отвергает этот нарратив. Он указывает на африканскую экосистему ИИ, которая развивается уже более десяти лет. Конференция Deep Learning Indaba началась в 2016 году как встреча для людей, занимающихся африканскими исследованиями, разработкой и инновациями в области ИИ. На ее встрече в 2026 году в Лагосе участвовало около 1000 человек. Фонд исследований Масахане, возникший из этого более широкого сообщества в 2019 году, по данным Marivate, вырос до более чем 3000 исследователей и новаторов, работающих над африканскими языками. Marivate подчеркнул: «Африканская экосистема ИИ не ждала. Они не ждали; эти организации начали десятилетие назад».
Необходимы инвестиции непосредственно в сами языки, включая разработку цифровых инструментов, исследовательский потенциал и образование. Правительства и частные компании также должны поддерживать локально разработанные технологии, вместо того чтобы просто импортировать или перепродавать системы, созданные в других местах. Он утверждает, что без закупок и инвестиций, поддерживающих африканские технологические компании и исследователей, устойчивая экосистема не сможет появиться. Это особенно важно, поскольку плохо работающие системы ИИ могут иметь последствия, выходящие за рамки неудобств. Marivate предупреждает, что если служба ИИ хорошо работает на английском, но дает ненадежные результаты на африканском языке, пользователи могут ошибочно полагать, что технология одинаково способна на всех языках, хотя это не так, что может привести к по-настоящему вредному опыту.
Следующий этап его работы заключается в оценке того, насколько хорошо существующие большие языковые модели на самом деле работают на африканских языках. Он признал, что Африка по-прежнему сильно зависит от технологий, разработанных за рубежом. Однако он считает, что создание местного научно-исследовательского потенциала позволит континенту предвидеть технологические изменения, а не просто реагировать на них. Он заключил: «Мы должны строить сами, чтобы затем научиться делать это лучше».
TextAugment изначально появился как ответ на ограниченное цифровое представление африканских языков. Его принятие демонстрирует более широкую возможность: когда африканские исследователи создают решения, соответствующие реалиям континента, они могут производить технологии, имеющие глобальную ценность.
