Pesquisadores sul-africanos desenvolveram uma ferramenta de software destinada a resolver um dos principais problemas enfrentados pelas línguas africanas na era digital, e agora ela está sendo usada por cientistas em todo o mundo.
Esta ferramenta, chamada TextAugment, foi criada para ajudar os desenvolvedores a criar tecnologias linguísticas quando não possuem uma grande quantidade de texto digital necessária para treinar sistemas de inteligência artificial. O software de código aberto foi desenvolvido pelo professor Vukosi Marivate, diretor do African Institute of Data Science and AI (AfriDSAI) e detentor da Cátedra Absa UP de Ciência de Dados na Universidade de Pretória, bem como pelo pesquisador Tshephisho Sefara. Atualmente, a ferramenta registrou mais de 286.000 downloads e é aplicada no trabalho com línguas como suahili, árabe e uzbeque.
A disseminação deste software foi marcada em 16 de julho, quando Marivate e a equipe do TextAugment receberam o primeiro Prêmio NSTF-SADiLaR Research Software Award por tecnologias de linguagem humana. Este prêmio é concedido por criar software de código aberto que ajuda os pesquisadores a gerar dados de treinamento sintéticos para línguas com recursos digitais insuficientes.
Este reconhecimento fez parte de uma série de prêmios recentes para Marivate. Em 19 de maio, o cientista da computação, nascido em Ga-Rankuwa, recebeu a Ordem de Prata de Mapungubwe por sua contribuição para as áreas de ciência de dados, inteligência artificial e processamento de linguagem natural. A presidência elogiou seu trabalho, destacando 'sua excelente contribuição para a ciência de dados, inteligência artificial (IA) e processamento de linguagem natural (PLN), que avançou significativamente as capacidades tecnológicas tanto nacionais quanto continentais'.
No entanto, seu trabalho vai além de simplesmente ensinar máquinas a entender a linguagem. Ele levanta uma questão mais ampla: o que acontecerá se as tecnologias que moldam o futuro não conseguirem compreender as línguas faladas por milhões de pessoas? Ele enfatizou que 'a mera existência da IA não é suficiente para que ela realmente impacte as pessoas'; é necessário criar as condições adequadas para amplificar os pontos positivos e minimizar as consequências negativas de qualquer tecnologia.
As línguas africanas são classificadas como línguas de 'baixo recurso' em pesquisas de IA. Na opinião de Marivate, isso não significa que há poucos falantes dessas línguas, mas sim que elas carecem de dados digitais e ferramentas que permitam às máquinas processá-las de forma eficaz. Ele explicou que 'um dos maiores obstáculos ao treinamento de modelos de aprendizado de máquina confiáveis para línguas de baixo recurso (como isiZulu, Sesotho ou Yoruba) é a falta de dados. Os modelos tradicionais de IA exigem uma enorme quantidade de dados limpos e rotulados para funcionar bem. Se tais dados estiverem ausentes, essas línguas são efetivamente excluídas da revolução moderna da IA.'
O problema de dados que exclui as línguas africanas da IA
Essa lacuna torna-se especialmente evidente na interação das pessoas com sistemas online. Por exemplo, sistemas de análise de sentimento podem determinar se um comentário online é positivo, negativo ou neutro. Mas os sistemas desenvolvidos predominantemente para o inglês não conseguem fornecer automaticamente o mesmo serviço para as línguas africanas.
Marivate observou: 'Na África do Sul, temos 12 línguas oficiais, e na verdade não atendemos a maioria das nossas pessoas. Para interagir com todos esses sistemas online, você é forçado a escrever em inglês, porque é assim que o processamento ocorre.'
Uma língua pode ter milhões de falantes, permanecendo pouco representada na internet. É aqui que entra uma das ferramentas de pesquisa mais utilizadas por Marivate. O TextAugment foi criado para ajudar os pesquisadores a contornar a escassez de dados linguísticos de alta qualidade. A ferramenta funciona através da expansão sintética de conjuntos de dados existentes, incluindo a substituição de palavras em frases por sinônimos, tentando manter o significado original.
Esta tecnologia suporta aplicações de tradução, análise de sentimento, sumarização e outras tarefas de processamento de linguagem. Ela também ajuda os pesquisadores a criar ferramentas como verificadores ortográficos e sistemas de processamento de fala. Finalmente, o TextAugment foi lançado como software de código aberto para que pesquisadores fora da equipe de Marivate pudessem utilizá-lo. Desde então, tem sido usado por pesquisadores que trabalham com línguas como suahili, uzbeque e árabe.
Criando IA que entende mais do que apenas palavras
No entanto, aumentar o volume de dados linguísticos para modelos de IA é apenas parte do problema. As línguas africanas carregam significados culturais, idiomatismos e provérbios que nem sempre podem ser traduzidos literalmente. Marivate reconhece que alguns métodos de aumento têm limitações, pois substituir uma palavra por um sinônimo nem sempre leva em conta o contexto em que essa palavra é usada.
Ele afirmou: 'Escrever em inglês e depois traduzir para isiXhosa não é o mesmo que uma pessoa escrevendo em isiXhosa, porque eles escrevem de uma forma que toca na cultura, na geografia e em muito mais que está dentro.'
Para Marivate, as tecnologias linguísticas africanas não devem se resumir a pegar sistemas em inglês e forçá-los a produzir palavras africanas. A tecnologia deve ser capaz de interagir com o contexto cultural em que essas línguas são usadas. Portanto, seu grupo de pesquisa está estudando como os modelos de IA entendem idiomatismos e provérbios em línguas africanas, incluindo isiZulu e Tshivenda.
O problema vai além de como a IA processa palavras individuais. Uma questão mais ampla sobre quais línguas e conhecimentos estão representados na IA também foi abordada pela vice-canceler Nana Aba Appiah Amfo, professora da Universidade de Gana, durante a Palestra de Honra da University of Warwick em 2026. Em uma palestra intitulada 'De qual língua importa? Vozes africanas, sistemas de conhecimento e o futuro da IA', Amfo investigou as consequências da exclusão de línguas em novas tecnologias e contestou pressupostos comuns sobre quais conhecimentos estão representados nos sistemas de IA.
Segundo ela, a ausência de línguas africanas nos ecossistemas digitais não é apenas uma limitação técnica, mas uma questão de representação e inclusão. Ela declarou: 'Quando uma língua está ausente no corpus digital, não é apenas um problema de tradução. É um problema de visibilidade. É um problema de conhecimento. E, em última análise, é uma questão de justiça.'
É fácil imaginar o desenvolvimento da IA na África como algo que começou com o surgimento do ChatGPT. Marivate rejeita esse enredo. Ele aponta para um ecossistema de IA africano que está em desenvolvimento há mais de dez anos. A conferência Deep Learning Indaba começou em 2016 como um encontro para pessoas envolvidas em pesquisas, desenvolvimento e inovação de IA africana. Sua reunião em 2026 em Lagos contou com cerca de 1000 participantes. O fundo de pesquisa Masakhane, surgido dessa comunidade mais ampla em 2019, cresceu para mais de 3000 pesquisadores e inovadores trabalhando com línguas africanas, segundo Marivate. Marivate enfatizou: 'O ecossistema de IA africano não esperou. Eles não esperaram; essas organizações começaram há uma década.'
São necessários investimentos diretamente nas próprias línguas, incluindo o desenvolvimento de ferramentas digitais, potencial de pesquisa e educação. Governos e empresas privadas também devem apoiar tecnologias desenvolvidas localmente, em vez de simplesmente importar ou revender sistemas criados em outros lugares. Ele argumenta que sem compras e investimentos que apoiem empresas e pesquisadores tecnológicos africanos, um ecossistema sustentável não poderá surgir. Isso é particularmente importante porque sistemas de IA mal funcionantes podem ter consequências que vão além do inconveniente. Marivate alerta que se um serviço de IA funciona bem em inglês, mas fornece resultados não confiáveis em uma língua africana, os usuários podem erroneamente presumir que a tecnologia é igualmente capaz em todos os idiomas, quando não é, o que pode levar a experiências verdadeiramente prejudiciais.
A próxima fase de seu trabalho é avaliar o quão bem os grandes modelos de linguagem existentes realmente funcionam em línguas africanas. Ele reconheceu que a África ainda depende fortemente de tecnologias desenvolvidas no exterior. No entanto, ele acredita que o desenvolvimento de capacidade de pesquisa local permitirá ao continente antecipar mudanças tecnológicas, em vez de apenas reagir a elas. Ele concluiu: 'Devemos construir nós mesmos para depois aprender a fazer isso melhor.'
O TextAugment surgiu inicialmente como resposta à representação digital limitada das línguas africanas. Sua adoção demonstra uma possibilidade mais ampla: quando pesquisadores africanos criam soluções que correspondem às realidades do continente, eles podem produzir tecnologias de valor global.

