Date: 2026-08-27
Topic: AI 교육·학습 효과
Primary source: OpenAI Economic Research
OpenAI는 2026년 8월 27일 보코니대학교 연구진과 함께 진행한 1,000명 이상 규모의 무작위 실험 결과를 공개했다. 1학년 학생들은 대학 기념품점의 마케팅 방안을 만드는 과제를 수행했고, 수업 단위로 ChatGPT 사용 여부와 인과추론 훈련 여부가 다른 네 집단에 배정됐다.
결과는 두 개입이 서로 다른 강점을 보였다는 쪽에 가깝다. GPT-4o를 쓸 수 있었던 학생들은 5점 평가에서 평균적으로 거의 1점 높은 결과를 냈고 답안의 논리와 완성도도 좋아졌다. 반면 비판적 사고 훈련을 받은 학생들은 정형화된 점수보다 아이디어의 다양성과 독창성에서 더 뚜렷한 변화를 보였다.
두 개입을 함께 받은 집단은 완성도와 아이디어 다양성의 이점을 동시에 나타냈다. 다만 이는 한 대학의 단일 마케팅 과제를 평가한 결과다. ChatGPT가 장기적인 이해력이나 기억력까지 높였다고 결론 내리기보다, AI 시대에는 결과물의 품질만으로 학습을 평가하기 어려워졌다는 신호로 읽는 편이 정확하다.
What Happened
보코니대와 OpenAI Economic Research는 생성형 AI와 비판적 사고 교육의 효과를 분리해 보기 위해 1,000명 이상의 1학년 학생을 대상으로 무작위 실험을 진행했다. 학생들은 실제 대학 기념품점의 인지도와 이용률을 높이는 마케팅 제안서를 작성했다.
수업별 배정에 따라 학생들은 다음 네 조건 중 하나에서 과제를 수행했다.
- GPT-4o 기반 ChatGPT에 접근할 수 있는 집단
- 원인과 결과를 연결하고 제안이 언제 실패할 수 있는지 따져 보는 인과추론 훈련 집단
- ChatGPT와 인과추론 훈련을 모두 받은 집단
- 두 개입을 모두 받지 않은 대조 집단
인과추론 훈련은 AI 사용법 교육이 아니었다. 게임과 사례, 질문, 피드백을 통해 주장과 결과 사이의 연결을 점검하는 별도의 사고 훈련이었다.
Key Details
제출물은 훈련받은 평가자가 5점 척도로 채점했다. 연구진은 별도로 자동 텍스트 분석을 사용해 아이디어의 수와 다양성, 인과추론의 흔적, 세 명의 전문가가 작성한 답안과의 유사성도 살폈다.
| 관찰 항목 | ChatGPT 접근 | 인과추론 훈련 |
|---|---|---|
| 5점 평가 점수 | 거의 1점 상승 | 뚜렷한 상승 없음 |
| 답안 구성 | 아이디어 수와 논리적 일관성 개선 | 제안이 작동할 조건과 실패 가능성을 더 잘 설명 |
| 아이디어의 폭 | 전문가 답안과 더 비슷해짐 | 동료와 겹치지 않는 아이디어가 늘어남 |
| 두 개입의 결합 | 높은 완성도 유지 | 아이디어 다양성도 함께 유지 |
여기서 점수가 높아졌다는 사실과 학습 자체가 깊어졌다는 주장은 구분해야 한다. 평가 기준은 기념품점의 인지도와 이용률을 높이는 제안이 얼마나 잘 정리됐는지를 측정했다. 학생이 과제 내용을 오래 기억하는지, 다른 문제에도 같은 추론 능력을 적용하는지, AI 없이도 실력이 유지되는지는 이번 공개 내용만으로 확인되지 않는다.
Background
이번 결과가 흥미로운 이유는 생성형 AI가 만든 매끄러운 결과물과 학생의 실제 사고 과정을 같은 것으로 보기 어려워졌기 때문이다. 전통적인 과제 평가는 최종 답안이 논리적이고 요구사항을 잘 충족하는지를 중심으로 점수를 매긴다. ChatGPT는 바로 이 부분에서 초보자와 전문가 사이의 표현·구성 격차를 빠르게 줄였다.
반대로 인과추론 훈련의 효과는 기존 평가표에서 충분히 잡히지 않았다. 새로운 아이디어를 냈는지, 전제를 의심했는지, 실패 조건까지 검토했는지는 정답형 기준과 잘 맞지 않기 때문이다. OpenAI도 앞서 시험 점수나 최종 에세이 같은 단기 지표만으로 AI의 학습 효과를 판단하기 어렵다며, 기억·끈기·메타인지 등을 장기간 살피는 측정 체계를 개발하고 있다고 밝혔다.
Core Lens
이번 연구의 핵심은 AI와 사고 훈련 중 하나를 고르는 데 있지 않고, 두 도구가 서로 다른 능력을 키운다는 점을 평가 방식에 반영해야 한다는 데 있다.
What It Means
학교와 대학이 곧바로 “ChatGPT를 쓰면 학습 성과가 오른다”고 일반화하기에는 근거가 아직 좁다. 이번 실험은 한 대학의 1학년 학생과 한 종류의 마케팅 과제에 한정됐고, 연구 결과를 소개한 기관 중 하나가 ChatGPT 개발사라는 점도 해석할 때 고려해야 한다.
그럼에도 실무적으로 얻을 수 있는 시사점은 분명하다. AI 사용을 금지하거나 허용하는 이분법만으로는 교육 설계가 충분하지 않다. 과제에는 결과물뿐 아니라 아이디어가 나온 과정, 대안 비교, 실패 조건, 출처 검증을 보여 주는 항목이 필요하다. AI가 문장을 다듬는 역할을 맡더라도 학생이 판단과 검증을 맡도록 평가 구조를 바꿔야 한다.
What To Watch
후속 연구에서는 다음 질문이 확인돼야 한다.
- 같은 효과가 과학·인문학·프로그래밍처럼 다른 과제에서도 재현되는가
- ChatGPT 접근을 끊은 뒤에도 사고력과 과제 수행 능력이 유지되는가
- 아이디어의 다양성이 실제 창의성 평가와 장기 학습 성과로 이어지는가
- 연령, 사전 지식, AI 활용 경험에 따라 효과가 달라지는가
- 독립 연구진의 반복 실험에서도 비슷한 결과가 나오는가
이 질문에 대한 자료가 쌓이기 전까지 이번 연구는 “AI가 학습을 대신한다”는 결론보다, AI가 잘 다듬은 결과물을 만드는 시대에 무엇을 학습 성과로 볼 것인지 다시 묻게 하는 초기 증거로 보는 것이 타당하다.
Sources
- Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training — OpenAI, 2026-08-27
- AI와 학습 성과를 이해하기 위한 새로운 도구 — OpenAI