« Que sait une machine ? » Cette question est généralement posée en termes de capacité : dans quelle mesure un système transcrit, traduit ou parle correctement. Cette présentation aborde cette question sous l’angle de l’épistémologie. Une machine qui a « appris » connaît de ses données, et uniquement de ses données. Elle n’observe pas le langage ; elle minimise les erreurs en s’appuyant sur les régularités statistiques présentes dans les données qui lui ont été fournies, stocke ces régularités en tant qu’informations a priori, puis « perçoit » le monde par inférence à partir de ces a priori (Hyvärinen 2024). Ce qui manque dans ses données d’apprentissage, la machine ne peut le savoir ; ce que ses données contiennent par hasard, elle le traite comme une loi.
Un deuxième point est moins souvent évoqué. Une machine ne connaît pas seulement ses données ; elle déduit des « connaissances » à partir de l’épistémologie qui préside à la conception de ses ensembles de données. Chaque ensemble de données encode des décisions concernant les limites, les catégories et la pertinence avant même qu’un seul exemple ne soit enregistré : ce qui compte comme une seule langue plutôt que deux, quelle variété est la référence et laquelle est le « dialecte », quelle orthographe est standard, quel accent est natif, quelle hésitation est du bruit. Ces catégories se présentent comme des descriptions neutres d’une réalité linguistique objective. Elles n’ont rien de tel. Le classement des langues d’Afrique en unités dénombrables, cartographiables et codables est le produit d’épistémologies ancrées dans un contexte historique et politique : la cartographie coloniale, l’orthographe missionnaire, le besoin des États-nations de disposer de populations administrables, et les registres de classification qui servent désormais de références par défaut à la technologie (Ngue Um 2025, à paraître). Intégrées dans les codes de localisation, les repères et les règles de validation, ces catégories ne sont pas simplement héritées par la machine, mais reproduites à grande échelle, et le coût de l’inadéquation entre la catégorie et l’expérience linguistique vécue est supporté par les locuteurs en leur qualité de détenteurs de savoir (Fricker 2007).
Si l’épistémologie d’un ensemble de données détermine ce qu’une machine peut savoir, la question décisive est de savoir qui conçoit, publie et régit les ensembles de données qui génèrent des connaissances sur l’expérience linguistique d’une communauté. J’appelle cela la « gestion responsable des données » : la capacité des acteurs de terrain du travail linguistique — locuteurs, enseignants, linguistes communautaires, étudiants — à participer non seulement à la contribution de données, mais aussi à décider de la manière dont elles sont structurées, selon quelles conditions elles circulent, et à qui elles sont destinées. La gestion responsable est la forme concrète de la justice épistémique dans l’économie des données.
La dernière partie s’appuie sur l’expérience avec Mozilla Data Collective, une plateforme sur laquelle les propriétaires d’ensembles de données publient, octroient des licences et gèrent leurs propres ressources. Grâce à l’Institut des humanités numériques africaines, plus de 150 ensembles de données linguistiques et culturelles ont été créés et publiés par des acteurs communautaires : des corpus oraux en afaan oromoo, isiXhosa, yoruba, igbo, haoussa, tiv, lingala, ewondo, fulfulde d’Adamawa et dans de nombreuses langues peu dotées ; des ressources lexicales multimodales ; des corpus parallèles ; et des ensembles de données socioculturelles qui documentent l’histoire, les liens de parenté, la religion, l’économie et les pratiques onomastiques d’une communauté plutôt qu’une « langue » abstraite de celle-ci. Ces ensembles de données sont gérés par les acteurs qui les ont produits, sous une licence qui exige des utilisateurs qu’ils déclarent leur objectif et partagent la valeur générée avec la communauté d’origine. Il en résulte une voie de collaboration entre ceux qui utilisent les données et les communautés dont elles proviennent, dans le cadre d’une interaction directe que ni la collecte de données extractive ni la publication universitaire conventionnelle n’ont permis jusqu’à présent.
J’en conclus que l’enjeu de l’IA pour les langues africaines ne réside pas en premier lieu dans l’accès à la technologie, mais dans la question de savoir quelle épistémologie prendra le dessus. Les machines auront des « convictions » sur les langues africaines, que les Africains conçoivent ou non les données ; la gestion responsable consiste à assumer la responsabilité de ces convictions.