AI教育

OpenAI研究、ChatGPTと批判的思考訓練が学生成果を異なる形で改善と示す

OpenAIはBocconi大学のランダム化実験を公表し、ChatGPTは完成度と論理性を、因果推論訓練はアイデア多様性を高めたと説明した。

公開日 更新日
OpenAIChatGPTAI教育

OpenAIは、ChatGPTへのアクセスと批判的思考の訓練が、学生の成果を異なるが補完的な形で改善することを示すランダム化教育実験の結果を公表した。同社は2026年8月27日にこの結果を発表した。研究はBocconi UniversityとOpenAI Economic Researchの協力で行われ、1000人を超える1年生の学部生が参加した。

実験では、学生にBocconi大学のグッズストア向けマーケティング提案を作成させた。学生は授業時間ごとに四つのグループへランダムに分けられた。GPT-4oを使うChatGPTへのアクセスを得るグループ、因果推論の訓練を受けるグループ、両方を受けるグループ、どちらも受けないグループである。因果推論の訓練はAIの使い方ではなく、原因と結果を結び、なぜ案が機能するのか、どの条件で失敗し得るのかを考える練習だった。

研究者は提出物を二つの方法で評価した。訓練を受けた人間の採点者が、標準的なマーケティング目標への対応を五段階のルーブリックで評価した。一方、自動テキスト分析は、アイデアの数と多様性、因果推論の痕跡、専門家の提案との類似度を測った。この二重の見方は重要だ。AIツールによって表面的に整った回答を作りやすくなるほど、洗練された答えと独自の答えは同じではなくなる。

ChatGPTの効果は採点上では明確だった。ChatGPTにアクセスできた学生は、五段階評価でほぼ1点高いスコアを得た。提出物にはより多くのアイデアが含まれ、論理が明確で、専門家の提案にも近かった。OpenAIは、学生が単に課題をモデルに丸投げしたわけではないと強調する。何を尋ねるかを決め、回答を評価し、最終提出に含める内容を選ぶ必要があった。

批判的思考訓練は別の効果を示した。訓練を受けた学生は、自分の案がなぜ機能し得るのか、いつ失敗し得るのかをより明確に説明したが、従来型のルーブリックでは高得点につながらなかった。自動分析では、彼らが同級生より幅広く、より異なるアイデアを生み出していたことが示された。これは教育評価の問題を浮かび上がらせる。整った標準的回答ばかりを評価すれば、学校が重視するはずの独創性を見落とし得る。

ChatGPTと因果推論訓練の両方を受けた学生は、最も広い範囲で改善を示した。アイデアの多様性は訓練のみのグループに近く、採点とアイデア数はChatGPTのみのグループに近かった。提出物には、論理の一貫性や仮定を問い直す姿勢もより強く表れた。研究は、学校がAI利用か独立思考かを単純に選ぶ必要はないことを示している。

実務的な示唆は、教育におけるAIを権限の問題だけでなく設計の問題として扱うべきだということだ。学生がAIで整った成果物を作れるなら、最終回答だけでは理解度が見えにくい。課題は独創性、推論過程、選択肢の比較、判断の根拠をより重視する必要がある。ChatGPTは専門性の差を埋められるが、批判的思考訓練はモデルの返答前後に学生が問題をどう捉えるかを変える。