AI를 쓰게 두면 학생이 생각을 덜 하게 될까 걱정될 수 있어요. 반대로 아예 막으면, 정작 실전에서 필요한 도구 쓰는 법을 못 배울 수도 있고요.
암스테르담 자유대학교의 티보 슈레펠 교수는 이 질문에 2년을 들여 직접 답을 구해봤어요.
AI를 막은 그룹이 두 해 다 시험에서도 꼴찌였어요
슈레펠 교수는 “AI법(Law of AI)” 수업 학생들을 세 그룹으로 무작위로 나눴어요.
4~5명씩 팀을 이뤄 20분 안에 EU AI법 조항 하나를 개선하는 같은 과제를 주고, 세 그룹의 조건은 다음과 같았어요.
- 첫 번째 그룹은 AI를 전혀 쓰지 못했어요.
- 두 번째 그룹은 사용법 안내 없이 챗지피티(ChatGPT)가 제안한 수정안을 그대로 받았어요.
- 세 번째 그룹은 법률 프롬프트 작성과 답변 검증을 훈련받은 뒤 AI를 썼어요.
2024년 66명으로 시작해 2025년 164명으로 참가자를 늘려 같은 실험을 반복했어요.
AI를 못 쓴 그룹은 20분 안에 AI 도움 없이 스스로 아이디어를 내야 했는데, 10~15분이 지나면 문구를 조금 다듬거나 불필요한 부분을 지우는 정도에 그치는 경우가 많았어요.
반면 안내 없이 챗지피티를 쓴 그룹은 제안을 비판 없이 받아들이는 경향을 보였어요.
그 결과 거의 모든 팀이 오도되거나 법적으로 무관한 용어를 최소 하나씩 그대로 남겼어요.
그런데 정작 시험에서는 이 허술함이 그대로 이어지지 않았어요. 두 해 다 시험 점수는 훈련받은 그룹이 가장 높았고, AI를 아예 못 쓴 그룹이 가장 낮았어요.
안내 없이 AI를 쓴 그룹은 과제에서는 허술했지만, 시험에서는 오히려 AI를 못 쓴 그룹보다 살짝 높은 점수를 받았어요.
슈레펠 교수는 원래 안내 없는 AI 사용이 아예 안 쓰는 것보다 해로울 거라 예상했었는데, 결과가 정반대로 나오자 자신의 예상이 틀렸다고 인정했어요.
적어도 이 실험에서는 AI 사용 금지가 오히려 더 손해였던 셈이에요. 훈련받은 그룹의 우위는 2024년엔 뚜렷했지만, 2025년엔 학생들이 챗지피티에 이미 익숙해져 있어서 격차가 크게 줄었어요.
숙제 점수와 감독 시험은 다르게 움직였어요
슈레펠 교수의 실험은 한 학기 안에서 통제된 조건으로 진행됐어요. 그런데 더 긴 기간 동안 실제 사용 습관을 관찰한 다른 연구들은 조금 다른 그림을 보여줘요.
UC버클리 고등교육연구센터가 50만 건 넘는 성적을 분석한 연구가 그중 하나예요.
챗지피티 등장 뒤 글쓰기·코딩 과목의 A학점 비율이 13%포인트 높아졌어요. 다만 사람이 감독하는 시험에서는 같은 변화가 나타나지 않았어요.
중국 중부 지역 초중고생을 추적한 연구에서는 한 걸음 더 나아간 패턴이 나왔어요.
스톡홀름대학교와 홍콩대학교 연구진이 2만6,000명을 30개월 동안 추적한 결과, AI를 쓴 학생들은 숙제 점수가 올랐지만 6개월 만에 월간 시험 성적이 20% 떨어졌고 입시 성적은 최대 24%까지 낮게 나타났어요.
다만 이 연구는 관찰 추적 연구라, AI 사용이 성적 하락의 직접적인 원인이라고 단정하기는 어려워요.

세 연구를 나란히 놓고 보면, AI 사용 금지도 무조건 오래 기대는 것도 정답은 아닌 것처럼 보여요.
슈레펠 교수의 실험에서는 AI를 아예 막은 그룹이 오히려 계속 뒤처졌지만, 숙제·과제에 AI를 습관적으로 오래 기댄 다른 연구들에서는 감독 시험 성적이 오히려 떨어지는 패턴이 나타났어요.
적어도 이 자료들만 놓고 보면, AI를 막느냐 쓰게 두느냐보다 그 사이에서 검증하는 과정을 얼마나 거치느냐가 실제 실력과 더 관련 있어 보여요.
AI가 정리해 준 답을 쓸 때, 출처와 논리를 직접 확인하는 단계가 내게 남아 있나요?




