Um novo artigo de Avijit Roy e Proma Roy, publicado no arXiv em 12 de agosto de 2026, mapeia onde a infraestrutura de IA falha com falantes de linguagens subrepresentadas. A resposta: em todas as camadas anteriores. Tokenização, corpora de treinamento e benchmarks de avaliação impõem penalidades que se acumulam. Bengali serve como estudo de caso—uma linguagem falada por aproximadamente 4% da população global, com números específicos o suficiente para serem operacionais.
Bengali representa menos de 0,5% do conteúdo global da web, uma subrepresentação de 8:1 contra sua participação populacional. Em grandes corpora de treinamento multilíngues, o déficit de tokens de treinamento de inglês para Bengali é de 67:1. Um modelo treinado em dados multilíngues padrão vê 67 tokens em inglês para cada token Bengali antes de qualquer atualização de peso. Isso não é um viés consequente de RLHF ou fine-tuning; está incorporado no pipeline de dados.
Tokenização adiciona uma segunda penalidade. Bengali usa um script silabário que tokenizadores BPE treinados em corpora pesados em inglês fragmentam em significativamente mais tokens por palavra—maior fertilidade—do que texto em inglês equivalente. O artigo Token Tax (analisando 16 linguagens africanas em 10 LLMs) confirma a consequência mecanística: fertilidade prediz confiabilidade a acurácia, com maior fertilidade correlacionando com menor acurácia. A razão é estrutural. O cálculo de atenção escala quadraticamente com o comprimento da sequência. Duplicar a contagem de tokens quadruplica o custo de treinamento e o tempo de inferência. Um déficit de dados de 67:1 combinado com fertilidade elevada significa que tarefas em linguagem Bengali enfrentam tanto treinamento insuficiente quanto penalidade computacional em cada transformer padrão.
Uma auditoria complementar comparando GPT-4o, Qwen2.5-7B e Mistral-7B encontrou penalidades de tokenização grandes o suficiente para importar em IA educacional de linguagens mal servidas—incluindo sistemas tutoriais offline em Bengali e ferramentas de API comerciais. O artigo também destaca Yoruba, uma linguagem com script latino com diacríticos tonais, produz fragmentação de tokens do GPT-4o maior que Bengali no mesmo corpus. Script não-latino não é a única vulnerabilidade; qualquer script pobremente coberto em dados de treinamento de vocabulário de tokenizador está exposto.
A camada de conectividade agrava o problema. Penetração de internet em Bangladesh rural é de 36,5% versus 71,4% urbana, significando que a população mais dependente de ferramentas de IA offline-first é menos representada em corpora de treinamento. Roy e Roy argumentam que deployment offline-first deveria ser tratado como infraestrutura de equidade, não como um contorno de baixa largura de banda. Modelos quantizados e edge inference não são otimizações de nicho; são o único mecanismo de entrega viável para usuários sem conexão confiável.
Para equipes construindo stacks de inferência multilíngues, três pontos de auditoria emergem. Primeiro, meça as razões de fertilidade de tokenizador por linguagem alvo antes de selecionar um tokenizador—não infira de benchmarks em inglês. GPT-4o, Qwen2.5 e Mistral divergem significativamente em scripts não-latinos, e a escolha se propaga através do tamanho da janela de contexto, pressão de memória e custos de API. Segundo, audite a composição do corpus contra participação populacional, não apenas disponibilidade de dados. Uma razão de 67:1 não é uma restrição orçamentária; é uma escolha de design que persiste ao longo da vida útil do modelo. Terceiro, benchmarks de avaliação construídos principalmente em inglês ou linguagens de alto recurso não surfaceão essas lacunas. Um modelo que pontua 90% em MMLU ainda pode falhar sistematicamente em entrada morfologicamente complexa de linguagens subrepresentadas.
O ângulo regulatório está ativo. Obrigações EU GPAI ativas desde agosto de 2025 exigem que provedores publiquem resumos de dados de treinamento. EU AI Act Artigo 10, que governa sistemas de alto risco incluindo IA em educação (aplicação total em dezembro de 2027), manda que datasets de treinamento sejam suficientemente representativos e examinados para viés que possa discriminar—com penalidades até €15M ou 3% do faturamento global anual. Subrepresentação estrutural de linguagem no nível do corpus é precisamente a lacuna que uma auditoria de representatividade surfaceará.
Viés estrutural em IA multilíngue não começa na inferência e não pode ser reparado em fine-tuning. Audite o tokenizador, audite o corpus, e espere reguladores perguntarem por documentação de ambos.