Accès à l’IA

Gates Foundation soutient des données linguistiques pour rendre l’IA plus inclusive

Une coalition soutenue par Gates Foundation veut élargir les données linguistiques de qualité nécessaires aux systèmes d’IA pour mieux servir les communautés sous-représentées.

Publié Mis à jour
Accès à l’IADonnées linguistiquesDéveloppement mondialIA responsable

Gates Foundation place l’infrastructure de l’intelligence artificielle au cœur d’un nouvel effort destiné à rendre les outils d’IA utiles aux populations souvent absentes de la première vague technologique. AP rapporte que la fondation a annoncé une initiative centrée sur les données linguistiques, avec plus de 60 partenaires issus d’entreprises technologiques, d’organisations à but non lucratif, d’universités et de groupes d’intérêt public. L’objectif est d’élargir les jeux de données de qualité dont les systèmes d’IA ont besoin pour répondre correctement aux communautés locales.

Le sujet paraît technique, mais ses conséquences sont concrètes. Les modèles modernes ne peuvent bien servir les personnes que s’ils disposent de données représentatives sur les langues, dialectes et contextes culturels utilisés au quotidien. Un chatbot performant en anglais peut être peu utile pour un agriculteur, une infirmière, un étudiant ou un commerçant parlant une langue peu présente en ligne. Cet écart risque de faire de l’IA une technologie de plus distribuée de manière inégale.

Selon AP, la coalition réunit notamment Anthropic, Google et OpenAI Foundation, ainsi que des partenaires de recherche et de la société civile. Elle ambitionne de toucher plus de trois milliards de personnes en cinq ans en soutenant de meilleures ressources linguistiques et une participation locale. Gates Foundation inscrit ce travail dans un effort plus large visant à orienter l’IA vers les besoins du développement mondial plutôt que vers les seuls marchés riches.

Un exemple mis en avant est Project Vaani en Inde, qui collecte des données audio dans différents districts afin d’améliorer les technologies vocales. Ce travail compte parce que la voix peut être plus accessible que le texte pour des personnes découvrant les outils numériques, disposant d’une alphabétisation limitée ou ayant besoin d’informations en travaillant dans des champs, des cliniques ou de petits commerces. De meilleures données vocales aident l’IA à comprendre accents, vocabulaire local et mélanges de langues.

Le projet soulève aussi des questions de gouvernance. Les données linguistiques peuvent contenir des savoirs culturels, des voix personnelles et une identité communautaire. Si les entreprises les extraient sans responsabilité, les communautés censées en bénéficier peuvent perdre le contrôle sur la représentation et la monétisation de leur langue. Une initiative crédible devra garantir le consentement, la gestion locale, la protection de la vie privée et des règles claires sur les bénéfices.

Pour les entreprises d’IA, l’initiative permet d’améliorer les modèles dans de vastes marchés mal documentés. Pour les acteurs du développement, elle teste la possibilité de façonner l’IA avant son déploiement. Le débat sur l’accès à l’IA ne porte plus seulement sur la connexion ou les appareils, mais sur la matière première même de l’IA et sur les personnes qu’elle représente.