AI 교육
OpenAI 연구, ChatGPT와 비판적 사고 훈련이 학생 과제를 다른 방식으로 개선
OpenAI는 Bocconi University 무작위 실험에서 ChatGPT는 완성도와 논리성을 높이고 인과 추론 훈련은 아이디어 다양성을 높였다고 밝혔다.
OpenAI가 ChatGPT 접근과 비판적 사고 훈련이 학생 과제를 서로 다르지만 보완적인 방식으로 개선한다는 무작위 교육 실험 결과를 공개했다. 회사는 2026년 8월 27일 이 결과를 발표했으며, 연구는 Bocconi University와 OpenAI Economic Research가 협력해 1,000명 이상의 1학년 학부생을 대상으로 진행했다.
실험에서 학생들은 Bocconi University 기념품 매장의 마케팅 제안을 만드는 실제 비즈니스 사례를 수행했다. 학생들은 수업 시간 단위로 네 그룹에 무작위 배정됐다. GPT-4o 기반 ChatGPT 접근권을 받은 그룹, 인과 추론 훈련을 받은 그룹, 둘 다 받은 그룹, 둘 다 받지 않은 그룹이다. 인과 추론 훈련은 AI 사용법 수업이 아니라 원인과 결과를 연결하고, 아이디어가 왜 효과적일 수 있는지와 언제 실패할 수 있는지 생각하도록 하는 게임식 연습이었다.
연구진은 제출물을 두 방식으로 평가했다. 훈련된 인간 평가자는 표준 마케팅 목표를 얼마나 잘 다뤘는지 5점 척도로 채점했다. 별도로 자동 텍스트 분석은 아이디어 수와 다양성, 인과 추론의 흔적, 전문가가 쓴 추천안과의 유사성을 측정했다. 이중 평가는 중요하다. AI 도구가 표면적으로 매끄러운 답을 쉽게 만들수록, 세련된 답과 독창적인 답이 항상 같은 것은 아니기 때문이다.
ChatGPT의 효과는 채점에서 분명했다. ChatGPT에 접근한 학생들은 5점 척도에서 거의 1점 높은 점수를 받았다. 이들의 과제는 더 많은 아이디어, 더 분명한 논리, 전문가 제안과 더 높은 유사성을 보였다. OpenAI는 학생들이 단순히 과제를 모델에 넘긴 것이 아니라고 강조했다. 무엇을 물을지 결정하고, 답변을 평가하고, 최종 제출물에 무엇을 넣을지 선택해야 했기 때문이다.
비판적 사고 훈련은 다른 결과를 만들었다. 훈련을 받은 학생들은 아이디어가 왜 작동할 수 있고 언제 실패할 수 있는지 더 잘 설명했지만, 전통적 채점 기준에서는 더 높은 점수를 받지 못했다. 자동 분석은 이들이 동료들과 더 구별되는 더 넓은 범위의 아이디어를 냈다는 점을 보여줬다. 이는 교육 평가 문제를 드러낸다. 명확하고 관습적인 답만 보상하면 학교가 중요하다고 말하는 독창성을 놓칠 수 있다.
ChatGPT 접근과 인과 추론 훈련을 모두 받은 학생들은 가장 넓은 범위의 향상을 보였다. 아이디어 다양성은 훈련만 받은 그룹과 비슷했고, 점수와 아이디어 수는 ChatGPT만 사용한 그룹과 비슷했다. 과제에는 더 강한 논리적 일관성과 가정을 의심하는 증거도 나타났다. 이 연구는 학교가 AI 사용과 독립적 사고 중 하나만 선택해야 한다는 단순한 논쟁을 흔든다.
실제 의미는 교육에서 AI를 권한 문제가 아니라 설계 문제로 봐야 한다는 것이다. 학생들이 AI로 polished output을 만들 수 있다면 최종 답안만으로는 이해도를 파악하기 어렵다. 과제는 독창성, 추론 과정, 대안 비교, 선택을 방어하는 능력을 더 평가해야 한다. ChatGPT는 전문성 격차를 줄일 수 있지만, 비판적 사고 훈련은 모델이 답하기 전후에 학생이 문제를 구성하는 방식을 바꾼다.