AIアクセス

Gates Foundation、低リソース言語のAIデータ整備を支援

Gates Foundationが支援する新連合は、主要AI企業や非営利団体とともに、AIに必要な高品質な言語データを広げることを目指す。

公開日 更新日
AIアクセス言語データ国際開発責任あるAI

Gates Foundationは、AIツールが最初の波から取り残されがちな人々にも届くよう、言語データを中心に据えた新しい取り組みを進めている。APによると、同財団はテクノロジー企業、非営利団体、大学、公共利益団体など60以上のパートナーが参加する連合を発表した。目的は、AIシステムが地域の言語や表現にきちんと反応するために必要な高品質データを増やすことだ。

これは一見すると技術インフラの話だが、影響は生活に直結する。現在のAIモデルは、十分な言語、方言、文化的文脈のデータがなければ、利用者の質問を正しく理解できない。英語では自然に動くチャットボットでも、オンライン上の資料が少ない言語では、農家、看護師、学生、小規模事業者を十分に助けられない可能性がある。そうなればAIは、すでに代表されている人だけに強い道具を与える技術になってしまう。

APの報道では、Anthropic、Google、OpenAI Foundationなどの主要AI関係者に加え、研究機関や市民社会の団体も参加している。連合は5年間で30億人以上に届くことを目標に、より良い言語資源と地域参加を支援する。Gates Foundationはこの取り組みを、AIを豊かな市場だけでなく保健、教育、金融、行政情報へのアクセスに役立てる大きな流れの一部と位置づけている。

具体例として挙げられているのが、インドのProject Vaaniだ。この取り組みは各地区で音声データを集め、音声技術の改善に役立てている。音声アクセスは、文字入力だけでは使いにくい人、識字に不安がある人、畑や診療所や店舗で作業しながら情報を必要とする人にとって重要である。地域の発音、混ざり合った言葉、地元の語彙を理解できることがAIの実用性を左右する。

同時に、言語データは慎重に扱う必要がある。そこには声、文化的知識、共同体のアイデンティティが含まれる。企業がそれを一方的に集め、利益だけを得るなら、支援されるはずの地域が自らの言語を管理する力を失いかねない。信頼できる計画には、同意、地域の管理、プライバシー保護、利益の配分が必要だ。

AI企業にとっては、データが少ない巨大市場でモデル性能を高める機会になる。開発団体にとっては、AIを被害が出てから修正するのではなく、導入前から公共目的に合わせて形作れるかを試す場になる。AIアクセスの議論は、接続や端末だけでなく、AIの素材そのものを誰が作り、誰のために使うのかという段階に移っている。