AI 접근성
Gates Foundation, 소외 지역 위한 AI 언어 데이터 연합 지원
Gates Foundation이 지원하는 새 연합은 주요 AI 기업, 비영리 단체, 연구기관과 함께 AI 시스템에 필요한 고품질 언어 데이터를 확대하려 한다.
Gates Foundation이 인공지능 인프라를 글로벌 개발 의제의 중심에 올려놓고 있다. AP에 따르면 재단은 언어 데이터를 중심으로 한 새 이니셔티브를 발표했으며, 기술 기업, 비영리 단체, 대학, 공익 조직 등 60개가 넘는 파트너가 참여한다. 목표는 AI 시스템이 지역 언어와 실제 표현을 제대로 이해하는 데 필요한 고품질 언어 데이터셋을 늘리는 것이다.
이 문제는 기술적으로 보이지만 영향은 매우 현실적이다. 현대 AI 모델은 언어, 방언, 문화적 맥락에 대한 충분한 대표 데이터가 있어야 사용자에게 신뢰할 만한 답을 줄 수 있다. 영어로는 잘 작동하는 챗봇도 온라인 자료가 적은 언어에서는 농민, 간호사, 학생, 소상공인을 제대로 돕지 못할 수 있다. 그렇게 되면 AI는 이미 디지털 세계에서 충분히 대표되는 사람들에게만 강력한 도구가 되고, 보건, 교육, 금융, 공공 서비스 정보가 절실한 사람들에게는 약한 도구가 된다.
AP 보도에 따르면 이 연합에는 Anthropic, Google, OpenAI Foundation 같은 주요 AI 관련 기관과 연구 및 시민사회 파트너가 포함된다. 연합은 5년 동안 30억 명 이상에게 도달하는 것을 목표로 하며, 더 나은 언어 자원과 지역 참여를 지원하려 한다. Gates Foundation은 이 작업을 더 넓은 AI 투자 흐름 속에 두고, AI가 부유한 시장의 상업 제품에만 머물지 않고 글로벌 개발 필요에 쓰이도록 하겠다는 뜻을 보였다.
보도에서 언급된 구체적 사례는 인도의 Project Vaani다. 이 프로젝트는 여러 지역에서 음성 데이터를 수집해 음성 기술 개선에 활용한다. 음성 접근은 문자 입력만으로 디지털 도구를 쓰기 어려운 사람들에게 특히 중요하다. 글을 읽고 쓰는 데 제약이 있거나 밭, 진료소, 작은 가게에서 일하며 정보를 얻어야 하는 사람에게는 음성 인터페이스가 더 현실적인 길이 될 수 있다. 좋은 음성 데이터는 억양, 지역어, 여러 언어가 섞인 표현을 이해하게 만든다.
하지만 언어 데이터에는 거버넌스 문제가 따른다. 그 안에는 개인의 목소리, 문화 지식, 공동체 정체성이 담길 수 있다. 기업이 이런 데이터를 일방적으로 가져가 상업적 가치만 얻는다면, 도움을 받아야 할 공동체가 자기 언어에 대한 통제력을 잃을 수 있다. 신뢰할 수 있는 계획에는 동의, 지역 주도 관리, 개인정보 보호, 이익 배분 원칙이 필요하다.
AI 기업에는 데이터가 부족한 거대 시장에서 모델 성능을 높일 기회가 된다. 개발 기관에는 AI를 피해가 발생한 뒤 고치는 것이 아니라 배포 전부터 공익 목적에 맞게 설계할 수 있는지 확인하는 시험이 된다. AI 접근성 논의는 이제 연결과 기기 보급을 넘어, AI의 원재료인 데이터가 실제 사용자들을 제대로 대표하는지로 옮겨가고 있다.