Выпускник инженерного факультета UKZN разработал переводчик жестового языка Южной Африки в реальном времени
Подробнее
IOL
iol.co.za

Выпускник инженерного факультета UKZN разработал переводчик жестового языка Южной Африки в реальном времени

Выпускник Университета Квазулу-Натал (UKZN) создал систему на основе искусственного интеллекта, способную переводить жестовый язык Южной Африки (SASL) в речь в режиме реального времени. Целью этой разработки является помощь людям с нарушениями слуха в преодолении коммуникационных барьеров.

Акхил Хансрадж создал Систему перевода SASL в речь в рамках своего выпускного проекта по получению степени бакалавра инженерии в области компьютерной инженерии. Эта система основана на компьютерном зрении и использует специально разработанную модель искусственного интеллекта вместе с устоявшимся фреймворком машинного обучения для отслеживания ориентиров тела и распознавания знаков в реальном времени.

Система обучалась на специальном наборе данных, относящемся к SASL, и способна идентифицировать отдельные буквы и слова, прежде чем преобразовать интерпретированные знаки в речь с помощью модели синтеза речи.

Преодоление трудностей

По словам научного руководителя Хансраджа, доктора Сулаймана Пателя, этот проект стал одним из первых проектов по вспомогательным технологиям в дисциплине Электро-, электронная и компьютерная инженерия (EECE) в UKZN, который был сосредоточен именно на диалекте жестового языка Южной Африки. Стоит отметить, что SASL недавно был признан одиннадцатым официальным языком Южной Африки, в то время как многие международные системы перевода жестового языка фокусируются на американском жестовом языке.

Для Хансраджа этот проект имел глубоко личную мотивацию, поскольку оба его родителя родились с нарушениями слуха и сталкивались с проблемами общения в повседневных ситуациях. Хансрадж отметил: «Мои родители сталкиваются с коммуникационными барьерами в повседневных условиях, таких как банки, государственные учреждения и муниципальные офисы». Он добавил, что ему и его сестре часто приходилось сопровождать родителей, чтобы говорить от их имени.

Хансрадж считает, что полностью готовая версия технологии позволит людям общаться более независимо. Он заявил: «Готовая к производству система даст этим людям возможность общаться легче и эффективнее, без необходимости в том, чтобы другая сторона выучила SASL».

Несмотря на то, что это выдающееся достижение, путь Хансраджа к выпуску был непростым. Патель сообщил, что во втором семестре 2025 года Хансрадж столкнулся с проблемами психического здоровья и ему потребовалось продление срока сдачи первого проекта. Благодаря поддержке Пателя, включая направление к студенческому консультанту и регулярные проверки состояния, Хансрадж смог восстановить темп работы над проектом. Его усилия в конечном итоге принесли ему высокую похвалу от EECE за выпускной проект.

Хансрадж также поделился, что больше всего ему нравились модули по проектированию во время обучения, поскольку они позволяли применять теоретические знания на практике в значимых проектах. Он также назвал модули «Сетевые коммуникации» и «Интернет-инженерия», преподаваемые профессором Тахмидом Кази, своими любимыми. Имея один завершающий модуль в 2026 году и сталкиваясь с финансовыми трудностями, Хансрадж был рекомендован Кази местной компании для собеседования. Он получил работу и совмещал ее с учебой на полную ставку.

Планы по дальнейшему развитию технологии

После получения степени бакалавра инженерии Хансрадж намерен продолжать развитие своего проекта по переводу жестового языка. Основное внимание будет уделено улучшению способности системы распознавать слова и генерировать более связную и плавную речь. В долгосрочной перспективе он планирует построить карьеру в сфере программного обеспечения, сетевых технологий или искусственного интеллекта и машинного обучения.

Хансрадж выразил благодарность своим родителям, дяде, сестре, Пателю, другу Амилу Махараджу, а также своему соседу по комнате, девушке и коллегам по университету за поддержку на протяжении всего пути. Помимо учебы, он увлекается играми, следит за технологическими разработками и работает над собственными проектами программирования. Он также благодарит UKZN за полученные знания и возможность познакомиться с университетской жизнью.

Похожие сюжеты

Инструмент, разработанный в Южной Африке, помогает языкам с ограниченными ресурсами войти в эпоху искусственного интеллекта
Подробнее
iol.co.za

Инструмент, разработанный в Южной Африке, помогает языкам с ограниченными ресурсами войти в эпоху искусственного интеллекта

Исследователи из Южной Африки разработали программный инструмент, призванный решить одну из главных проблем, стоящих перед африканскими языками в цифровую эпоху, и теперь он используется учеными по всему миру.

Этот инструмент, получивший название TextAugment, создан для помощи разработчикам в создании языковых технологий, когда у них отсутствует огромное количество цифрового текста, необходимого для обучения систем искусственного интеллекта. Программное обеспечение с открытым исходным кодом было разработано профессором Vukosi Marivate, директором Африканского института науки о данных и ИИ (AfriDSAI) и обладателем кресла Absa UP Chair of Data Science в Университете Претории, а также исследователем Tshephisho Sefara. На данный момент инструмент зарегистрировал более 286 000 загрузок и применяется в работе с такими языками, как суахили, арабский и узбекский.

Распространение этого программного обеспечения было отмечено 16 июля, когда Marivate и команда TextAugment получили первый Награду NSTF-SADiLaR Research Software Award за технологии человеческого языка. Эта награда присуждается за создание программного обеспечения с открытым исходным кодом, которое помогает исследователям генерировать синтетические обучающие данные для языков с недостаточными цифровыми ресурсами.

Признание стало частью серии недавних наград для Marivate. 19 мая компьютерный ученый, родившийся в Га-Ранкуве, получил Орден Мапунгубве Серебра за свой вклад в области науки о данных, искусственного интеллекта и обработки естественного языка. Президентство высоко оценило его работу, отметив «его превосходный вклад в науку о данных, искусственный интеллект (ИИ) и обработку естественного языка (NLP), который значительно продвинул как национальные, так и континентальные технологические возможности».

Однако его деятельность выходит за рамки простого обучения машин пониманию языка. Она ставит более широкий вопрос: что произойдет, если технологии, формирующие будущее, не смогут понять языки, на которых говорят миллионы людей? Он подчеркнул, что «самого существования ИИ недостаточно, чтобы он действительно повлиял на людей»; необходимо создать подходящие условия для усиления положительных моментов и минимизировать негативные последствия любой технологии.

Африканские языки в исследованиях ИИ классифицируются как языки с «низкими ресурсами». По мнению Marivate, это не означает, что таких языков мало говорящих, а скорее то, что им не хватает цифровых данных и инструментов, позволяющих машинам эффективно их обрабатывать. Он объяснил, что «одно из самых больших препятствий при обучении надежных моделей машинного обучения для языков с низкими ресурсами (таких как isiZulu, Sesotho или Yoruba) — это нехватка данных. Традиционные модели ИИ требуют огромного количества чистых, размеченных данных для хорошей работы. Если такие данные отсутствуют, эти языки фактически исключаются из современной революции ИИ».

Проблема данных, которая исключает африканские языки из ИИ

Этот пробел становится особенно очевидным при взаимодействии людей с онлайн-системами. Например, системы анализа настроений могут определять, является ли отзыв в сети положительным, отрицательным или нейтральным. Но системы, разработанные преимущественно для английского языка, не могут автоматически предоставлять такую же услугу для африканских языков.

Marivate отметил: «В Южной Африке у нас 12 официальных языков, и мы на самом деле не обслуживаем большинство наших людей. Чтобы взаимодействовать со всеми этими онлайн-системами, вас вынуждают писать на английском, потому что именно так происходит обработка».

Язык может иметь миллионы носителей, оставаясь при этом слабо представленным в интернете. Именно здесь в игру вступает один из наиболее часто используемых исследовательских инструментов Marivate. TextAugment был создан для того, чтобы помочь исследователям обойти дефицит высококачественных языковых данных. Инструмент работает путем синтетического расширения существующих наборов данных, включая замену слов в предложениях синонимами с попыткой сохранить первоначальный смысл.

Эта технология поддерживает приложения для перевода, анализа настроений, суммаризации и другие задачи обработки языка. Она также помогает исследователям создавать такие инструменты, как проверки орфографии и системы для обработки письменной речи. В конечном итоге TextAugment был выпущен как программное обеспечение с открытым исходным кодом, чтобы исследователи за пределами команды Marivate могли им пользоваться. С тех пор он использовался исследователями, работающими с такими языками, как суахили, узбекский и арабский.

Создание ИИ, который понимает больше, чем просто слова

Однако увеличение объема языковых данных для моделей ИИ — это лишь часть проблемы. Африканские языки несут культурные значения, идиомы и пословицы, которые нельзя всегда перевести дословно. Marivate признает, что некоторые методы аугментации имеют ограничения, поскольку замена слова синонимом не обязательно учитывает контекст, в котором это слово используется.

Он заявил: «Написание на английском и последующий перевод на isiXhosa — это не то же самое, что человек, пишущий на isiXhosa, потому что они пишут так, что затрагивает культуру, географию и многое другое, что находится внутри».

Для Marivate африканские языковые технологии не должны сводиться к тому, чтобы взять англоязычные системы и заставить их выдавать африканские слова. Технология должна быть способна взаимодействовать с культурным контекстом, на котором эти языки используются. Поэтому его исследовательская группа изучает, как модели ИИ понимают идиомы и пословицы в африканских языках, включая isiZulu и Tshivenda.

Проблема выходит за рамки того, как ИИ обрабатывает отдельные слова. Более широкий вопрос о том, чьи языки и знания представлены в ИИ, был также рассмотрен вице-канцлером Университета Ганы, профессором Nana Aba Appiah Amfo, во время Лекции отличия Университета Уоррика 2026 года. В лекции под названием «Чей язык имеет значение? Африканские голоса, системы знаний и будущее ИИ» Амфо исследовала последствия исключения языков в новых технологиях и оспорила общепринятые предположения о том, чьи знания представлены в системах ИИ.

По ее словам, отсутствие африканских языков в цифровых экосистемах — это не просто техническое ограничение, а вопрос репрезентации и включенности. Она заявила: «Когда язык отсутствует в цифровом корпусе, это не просто проблема перевода. Это проблема видимости. Это проблема знаний. И в конечном счете, это вопрос справедливости».

Легко представить развитие ИИ в Африке как нечто, начавшееся с появления ChatGPT. Marivate отвергает этот нарратив. Он указывает на африканскую экосистему ИИ, которая развивается уже более десяти лет. Конференция Deep Learning Indaba началась в 2016 году как встреча для людей, занимающихся африканскими исследованиями, разработкой и инновациями в области ИИ. На ее встрече в 2026 году в Лагосе участвовало около 1000 человек. Фонд исследований Масахане, возникший из этого более широкого сообщества в 2019 году, по данным Marivate, вырос до более чем 3000 исследователей и новаторов, работающих над африканскими языками. Marivate подчеркнул: «Африканская экосистема ИИ не ждала. Они не ждали; эти организации начали десятилетие назад».

Необходимы инвестиции непосредственно в сами языки, включая разработку цифровых инструментов, исследовательский потенциал и образование. Правительства и частные компании также должны поддерживать локально разработанные технологии, вместо того чтобы просто импортировать или перепродавать системы, созданные в других местах. Он утверждает, что без закупок и инвестиций, поддерживающих африканские технологические компании и исследователей, устойчивая экосистема не сможет появиться. Это особенно важно, поскольку плохо работающие системы ИИ могут иметь последствия, выходящие за рамки неудобств. Marivate предупреждает, что если служба ИИ хорошо работает на английском, но дает ненадежные результаты на африканском языке, пользователи могут ошибочно полагать, что технология одинаково способна на всех языках, хотя это не так, что может привести к по-настоящему вредному опыту.

Следующий этап его работы заключается в оценке того, насколько хорошо существующие большие языковые модели на самом деле работают на африканских языках. Он признал, что Африка по-прежнему сильно зависит от технологий, разработанных за рубежом. Однако он считает, что создание местного научно-исследовательского потенциала позволит континенту предвидеть технологические изменения, а не просто реагировать на них. Он заключил: «Мы должны строить сами, чтобы затем научиться делать это лучше».

TextAugment изначально появился как ответ на ограниченное цифровое представление африканских языков. Его принятие демонстрирует более широкую возможность: когда африканские исследователи создают решения, соответствующие реалиям континента, они могут производить технологии, имеющие глобальную ценность.

Инноваторы из Кении используют робототехнику для обеспечения доступа к образованию на языке жестов
Подробнее
cgtn.com

Инноваторы из Кении используют робототехнику для обеспечения доступа к образованию на языке жестов

В Кении молодая команда новаторов применяет робототехнику для преодоления одного из препятствий, с которыми сталкиваются учащиеся с нарушениями слуха — это доступ к обучению на языке жестов.

Хотя данная технология находится на стадии разработки, ее создатели полагают, что в будущем она сможет сделать технические предметы более доступными для учеников с потерей слуха.

В классе в Найроби общение в значительной степени происходит посредством движений. Однако для глухих студентов освоение сложных дисциплин представляет собой особый вызов, особенно когда словарный запас, необходимый для объяснения математики, науки или технологий, отсутствует в знаках, которые они знают.

Ева Авино, преподаватель в средней школе для глухих Kasarani Treeside Secondary School for the Deaf, отметила: «Я преподаю физику, и в большинстве случаев мы понимаем, что концепции, которые мы преподаем, и способ, которым я могу выразить концепцию, становятся проблемой в какой-то момент из-за знаков и словарного запаса, необходимого для выражения данной концепции».

Именно эту проблему пытается решить кенийский стартап ZeroBionic. В своей лаборатории в Найроби инженеры обучают машины общаться на языке жестов.

Для соучредителя Норы Кимати идея началась с чего-то гораздо более простого. Кимати рассказала: «Мы начали всего с базовых роботизированных рук. Поскольку язык жестов полностью основан на руках, мы решили начать с рук и посмотреть, как это пойдет. Затем мы получили отзыв о том, что в языке жестов многое зависит от него».

Она продолжила: «Например, выполнение этого означает более пяти разных вещей в определенном языке жестов, основываясь на ваших мимических выражениях. Именно тогда мы решили построить полноценного гуманоида, включая лицо, включая глаза, включая все, чтобы уловить все невербальные сигналы, которые в настоящее время присутствуют».

Однако обучение машины жестам требует большего, чем просто аппаратное обеспечение; необходимы данные. Когда ZeroBionic начал поиск наборов данных африканского языка жестов, команда сообщила, что материала для работы было очень мало.

В лаборатории каждое движение фиксируется, записывается и преобразуется в данные, которые могут обучить систему. ZeroBionic утверждает, что текущая задача заключается в том, чтобы сделать технологию более умной, точной и полезной в реальном мире. Для студентов, наблюдающих за развитием этой технологии, она символизирует нечто большее, чем просто машина.

Популярное