Недавнее исследование, проведенное в рамках докторской диссертации, привело к созданию многоязычных инструментов искусственного интеллекта (ИИ), способных обнаруживать ложную информацию на языках Южной Африки. Это решение направлено на устранение недостаточной представленности африканских языков в сфере ИИ.
Научные достижения и фокус исследования
Доктор Сеани Рананга, преподаватель кафедры компьютерных наук в Университете Претории, продемонстрировала, что многоязычный ИИ может идентифицировать вводящую в заблуждение информацию на языках Исизулу, английском и Сепеди. Ее диссертация, завершенная в Университете Северо-Запада, была сосредоточена на таких областях, как обработка естественного языка, многоязычный ИИ и обнаружение дезинформации в африканских языках, получив при этом мировое признание.
В качестве пилотного кейса для проверки многоязычной структуры Рананга использовала дезинформацию, связанную с пандемией Covid-19. Она подчеркнула, что данное исследование было мотивировано необходимостью гарантировать, что носители коренных языков Южной Африки не останутся позади по мере роста значимости ИИ в выявлении фейков.
Проблемы языкового разнообразия
Рананга отметила, что Южная Африка является одной из самых лингвистически разнообразных стран мира, однако большинство систем ИИ для обнаружения дезинформации разрабатываются преимущественно для английского языка. Это ставит носителей местных языков в невыгодное положение при поиске достоверной информации в интернете.
В своей диссертации Рананга сначала сосредоточилась на изучении английского, исизулу и сепеди по отдельности для создания прочного фундамента. Исследование охватывало как модели машинного перевода, так и многоязычные модели ИИ. Машинный перевод помог создать языковые ресурсы там, где данных было очень мало, в то время как многоязычные модели обучались понимать исизулу и сепеди напрямую.
Вызовы создания ресурсов
При работе над проектом участвовали носители языка для проверки качества переводов. Тем не менее, сохранение культурного смысла и идиоматических выражений остается постоянной проблемой, что требует дальнейшего сотрудничества с лингвистами и носителями языка. Рананга указала, что самой сложной задачей было не создание самой модели ИИ, а формирование качественных языковых ресурсов.
Поскольку размеченные данные о дезинформации для африканских языков ограничены, она объединила машинный перевод, проверку человеком и генерацию синтетических данных для разработки надежных обучающих материалов для исизулу и сепеди. Одним из ключевых выводов ее работы стало то, что инвестиции в высококачественные ресурсы африканских языков столь же важны, как и разработка более совершенных моделей ИИ.
Перспективы внедрения системы
Описывая план внедрения этой структуры для защиты сообществ во время критических событий, таких как выборы или кризисы общественного здравоохранения, Рананга уточнила, что текущая структура представляет собой исследовательский прототип, но долгосрочное видение гораздо шире. Она видит ее частью многоязычной платформы для проверки фактов, где пользователи смогут верифицировать подозрительные сообщения, изображения, аудио или видео перед их распространением.
В случае выборов или чрезвычайных ситуаций в области здравоохранения такая система могла бы оказывать поддержку фактчекерам, журналистам, правительству и общественности, предоставляя быстрые, основанные на доказательствах проверки на языках Южной Африки. Рананга также отметила, что одна из самых трудных задач для ИИ — это то, что ложь часто опирается на сарказм, иронию или локальный юмор, а не на очевидные ложные факты. Понимание сарказма, юмора и культурного контекста требует анализа не только слов, но и намерения и контекста.
Будущие направления исследований
Рананга добавила, что, хотя ИИ улучшается, это остается активной областью исследований. Ее будущая работа будет сосредоточена на включении разговорного контекста, мультимодальной информации, такой как изображения и видео, а также объяснимого ИИ для повышения прозрачности и надежности этих систем. Еще один вызов, который она выделила, — это то, что южноафриканцы часто переключаются между языками в середине предложения. Следующий этап исследования будет посвящен обучению и оценке структуры на реальных разговорах в социальных сетях, которые включают смешение кодов, сленг и местные выражения, чтобы лучше отражать естественную коммуникацию южноафриканцев в сети.
Рананга подчеркнула, что развитие ИИ для африканских языков требует сотрудничества. Она выразила надежду сделать модели, бенчмарки, код и другие исследовательские ресурсы доступными везде, где это возможно, соблюдая при этом этические, правовые требования и требования к обмену данными. Цель состоит в том, чтобы поддержать других исследователей и ускорить разработку технологий ИИ, которые лучше служат африканским языкам и сообществам.
Доктор Рананга получила стипендию Google PhD Fellowship, одну из ведущих мировых наград, поддерживающих докторские исследования в области ИИ. Она также получила награду «Лучший постер» на Deep Learning IndabaX South Africa в 2025 году, что обеспечило ей финансирование для представления исследования на Deep Learning Indaba в Панамериканском университете в Лагосе, Нигерия, в августе 2026 года.
Профессор Сихаву Нгубане, эксперт по культуре из Университета Квазулу-Натал, поздравил Ранангу с этим достижением. Он заявил, что исследование сыграет важную роль в развитии и продвижении коренных языков, помогая им выйти на мировую арену, поскольку Политика Южной Африки позволяет говорить на всех 12 официальных языках, и ее намерение включить их все сыграет большую роль в этой стране, которая отличается огромным культурным и языковым разнообразием.

