사고의 외주화, 6개월 후 Part 1: 진단은 맞았는가
이 글은 Claude Opus 5 를 이용해 초안이 작성되었으며, 이후 퇴고를 거쳤습니다.
들어가며: 근거 없는 글이었습니다#
2026년 2월 11일, 「사고의 외주화: AI 시대, Co-pilot과 Autopilot 사이」를 발행했습니다. 생성형 AI 에 추론과 판단을 통째로 맡기는 현상을 진단하고, 네 가지 문제와 네 가지 액션 플랜을 제시한 글입니다.
그 글에는 근거가 하나도 붙어 있지 않습니다. 인용도, 수치도, 출처도 없습니다. 읽으면 그럴듯하고, 그럴듯하다는 것 외에는 아무것도 보증하지 않는 글입니다. AI 가 초안을 쓰고 사람이 다듬은 글이 어떤 모습인지에 대한 표본으로도 읽을 수 있겠습니다.
6개월이 지났습니다. 그 사이 이 주제는 논평의 영역에서 데이터의 영역 으로 넘어왔습니다. 참가자 1,222명 규모의 무작위 대조 실험이 나왔고, 320만 건의 학습 로그를 10년치로 훑은 준실험이 나왔고, Trends in Cognitive Sciences 에 130편 이상을 종합한 리뷰가 실렸고, Nature 가 뉴스 지면에서 “초기 결과가 나왔는데 좋지 않다"고 썼습니다.
이 시리즈는 그 자료들로 원문을 다시 채점합니다. 판정은 세 가지입니다.
- 유지 — 2026년 근거가 원래 주장을 지지합니다
- 수정 — 결론은 맞지만 이유나 초점이 틀렸습니다
- 폐기 — 근거가 반대 방향을 가리키거나, 전제 자체가 낡았습니다
방법론을 먼저 밝힙니다. 근거는 가급적 2026년 발표분으로 한정했고, 부득이하게 2025년 이전 자료를 쓸 때는 본문에 연도를 명시했습니다. 이 분야는 6개월이면 결론이 뒤집히기 때문입니다. 그리고 출처의 성격 — 무작위 통제 실험인지, 관찰 연구인지, 벤더 자체 텔레메트리인지, 자가보고 설문인지 — 를 함께 적었습니다. 같은 숫자라도 무게가 다릅니다.
이번 편은 진단부 입니다. 액션 플랜은 Part 2, 6개월 사이 새로 생긴 것들은 Part 3 에서 다룹니다.
먼저 결론표부터 놓겠습니다.
| 원문의 주장 | 판정 | 결정적 근거 |
|---|---|---|
| 전제: 고민이 생략되면 성장도 생략된다 | 유지 (조건절 필요) | Liu et al. 2026 (n=1,222 RCT) |
| ① 비판적 사고력의 근손실 | 유지 (위치를 특정해야 함) | Huemmer et al. 2026 종단 연구 |
| ② 사고의 평균화·획일화 | 수정 (결론 유지, 메커니즘 오류) | Karouzos et al. 2026 |
| ③ 주체성과 책임의 증발 | 유지 (수치가 붙음) | Charlotin DB 2026 |
| ④ 환각의 무비판적 수용 | 수정 (초점 이동) | 모델은 개선, 사고는 2배 |
전제 재검증: “고민을 건너뛰면 성장도 건너뛴다”#
원문은 이렇게 썼습니다.
문제는 ‘고민의 과정’이 생략되면 ‘성장’도 생략된다 는 점입니다. 근육을 쓰지 않으면 위축되듯, 복잡한 문제를 붙들고 씨름하는 ‘인지적 마찰’이 없으면 우리의 사고력은 퇴화할 수밖에 없습니다.
당시에는 비유였습니다. 지금은 실험 결과가 있습니다.
1,222명, 그리고 10분#
Grace Liu, Brian Christian, Tsvetomira Dumbalska, Michiel A. Bakker, Rachit Dubey 가 2026년 4월에 공개한 「AI Assistance Reduces Persistence and Hurts Independent Performance」(arXiv 2604.04721) 는 무작위 대조 실험 3건, 총 참가자 1,222명 규모입니다. 과제는 분수 연산(실험 1·2)과 독해(실험 3)였습니다.
결과는 세 문장으로 요약됩니다.
- AI 를 쓰는 동안에는 성적이 올랐습니다.
- AI 를 치우자 성적이 유의하게 떨어졌고, 문제를 포기하는 비율이 늘었습니다.
- 이 효과가 나타나는 데 걸린 시간은 약 10분 이었습니다.
세 번째가 중요합니다. 원문은 “장기적 퇴화"를 걱정했습니다. 실험은 10분 노출 뒤에 이미 측정된다 고 말합니다. 저자들의 해석은 이렇습니다. AI 는 사람을 “즉답을 기대하는 상태"로 조건화하고, 그 결과 스스로 헤쳐 나가는 경험 자체를 박탈 한다는 것입니다.
그리고 이 논문의 진짜 값어치는 갈라진 지점에 있습니다.
챗봇에게 직접 답을 요구한 참가자는 정답률 하락이 가장 컸고 건너뛴 문항이 약 두 배였습니다. 힌트나 설명을 요구한 참가자는 AI 를 아예 쓰지 않은 통제군과 비슷했습니다.
같은 도구, 같은 시간, 정반대의 결과입니다. 이 문장은 Part 2 의 액션 플랜을 통째로 다시 쓰게 만듭니다.
인구 규모에서도 같은 방향#
개별 실험이 아니라 모집단 전체를 본 연구도 나왔습니다. Sina Rismanchian 등이 2026년 5월에 공개한 「Faster Completion, Less Learning」(arXiv 2605.21629) 은 ALEKS 학습 플랫폼의 상호작용 320만 건, 10년치 를 분석했습니다.
설계가 영리합니다. 텍스트 기반 문제(AI 로 풀기 쉬움)와 그래프 상호작용 문제(AI 로 풀기 어려움)를 비교하고, 감독 시험(proctored) 성적을 대조군으로 삼았습니다.
| 집단 | AI 취약 문제 학습시간 변화 |
|---|---|
| 대학생 | 분기당 −2.8%, 11분기 누적 −26.9% |
| 고교생 | −31.3% |
| 중학생 | −9.0% |
| 초등 5학년 | 유의한 변화 없음 |
그리고 대학생의 감독 시험 정답 오즈가 누적 25% 감소 했습니다. 감독 시험에서는 AI 를 쓸 수 없으므로, 이것은 “AI 로 답을 맞혔다"가 아니라 “실제로 덜 알게 되었다” 에 가깝습니다.
Nature 는 2026년 6월 18일 뉴스 지면에서 이 흐름을 「Is AI ruining our skills? Early results are in — and they’re not good」이라는 제목으로 다뤘습니다(Nature 655, 15–16). 부제는 “인공지능 도구에 대한 의존이 의사와 소프트웨어 엔지니어의 능력을 저하시킨다"입니다. (본문은 유료 구독이라 저는 표제·부제와 참고문헌 목록만 확인했습니다. 인용된 문헌은 Budzyń et al. 2025, Shen & Tamkin 2026, Rinta-Kahila et al. 2018, Wolters Kluwer 2026 설문입니다.)
그런데 조건절이 빠졌습니다#
여기까지만 보면 원문이 이겼습니다. 그런데 같은 시기의 종합 연구들이 붙이는 조건이 있습니다.
CHI 학회에 실린 「Generative AI Tools in Higher Education: A Meta-Analysis of Cognitive Impact」는 대학생 인지 성과에 대한 생성형 AI 의 전체 효과크기를 1.34(95% CI 1.17~1.50) 로 보고합니다. 크고, 긍정적입니다. 다만 Bloom 분류상의 사고 수준이 유의한 조절변수 였고, 고차 사고로 갈수록 효과가 작아졌습니다.
Computers and Education: Artificial Intelligence 에 실린 체계적 문헌고찰(2022~2025년 실증 연구 67편, PRISMA)의 결론도 같은 방향입니다. 탐구 중심으로 설계되고 비계(scaffold)가 붙은 수업에서는 ChatGPT 가 인지 발달을 지원 했습니다. 반면 비구조적 맥락 에서는 창의성 쪽으로 치우친 비대칭이 나타나거나 두 영역이 함께 하락했고, 두 경우 모두 인지적 외주화가 촉발되었습니다.
그러니까 정확한 문장은 이렇습니다.
AI 가 사고력을 퇴화시키는 것이 아니라, 구조 없이 쓰는 AI 가 퇴화시킵니다.
원문은 이 조건절 없이 “퇴화할 수밖에 없습니다"라고 썼습니다. 방향은 맞았고 단정은 과했습니다.
판정: 유지. 단, 무조건절을 조건절로 바꿔야 합니다.
① 비판적 사고력의 근손실 — 유지하되, 근육의 위치가 다릅니다#
원문은 “논리의 허점을 찾아내거나 ‘왜?‘라고 질문하는 능력이 무뎌진다"고 썼습니다. 맞습니다. 그런데 2026년 데이터는 어느 지점에서 무뎌지는지 를 훨씬 구체적으로 알려 줍니다.
신뢰가 클수록 덜 생각합니다#
기준선이 되는 연구는 Microsoft Research 와 카네기멜런대의 Lee, Tankelevitch 등이 CHI 2025 에서 발표한 「The Impact of Generative AI on Critical Thinking」입니다. 2025년 자료 임을 밝혀 둡니다. 지식노동자 319명, 실제 사용 사례 936건 을 자가보고로 수집했습니다.
- AI 에 대한 신뢰가 높을수록 비판적 사고에 관여하는 정도가 낮았습니다.
- 자기 능력에 대한 신뢰가 높을수록 관여도가 높았습니다. 다만 인지 비용을 더 크게 느꼈습니다.
즉 비판적 사고를 끄는 스위치는 게으름이 아니라 신뢰 입니다. 이건 도덕의 문제가 아니라 보정(calibration)의 문제라는 뜻이고, 처방도 달라집니다.
그리고 정확히 어디가 끊기는가: 검증#
2026년 1월에 공개된 Matthias Huemmer 등의 「AI, Metacognition, and the Verification Bottleneck」(arXiv 2601.17055)은 6개월 3-wave 종단 연구입니다. 학계 참가자를 대상으로 했고, 저자들 스스로 표본 동질성·자가보고·무작위 통제 부재를 한계로 적었습니다. 그 한계를 감안하고 보면 그림이 선명합니다.
| 지표 | 값 |
|---|---|
| 일상적 AI 사용 비율 | 52.4% → 95.7% (6개월) |
| ChatGPT 채택률 | 100% (포화) |
| 어려운 과제에서의 AI 의존 | 73.9% |
| 같은 구간의 검증 자신감 | 68.1% |
| 난이도별 정확도 | 95.2% → 47.8% |
| 확신과 실제 성과의 격차 | 34.6%p |
저자들이 “검증 역설(verification paradox)“이라고 부른 것은 이 조합입니다. 실제 정확도가 가장 낮은 어려운 과제에서 의존이 가장 높고, 바로 그 지점에서 검증할 자신은 없습니다.
원문의 “근손실"이라는 비유는 사고력 전반이 균일하게 약해지는 그림을 그립니다. 데이터가 그리는 그림은 다릅니다. 아이디어를 내는 능력, 문장을 쓰는 능력, 코드를 읽는 능력은 대체로 유지되거나 오히려 좋아집니다. 끊기는 것은 “이 답이 맞는지 확인하는” 한 지점 입니다.
실제로 얼마나 확인하는가#
수치는 조사에 따라 크게 흔들리므로 두 개를 나란히 놓겠습니다.
- 2026년 4월 미국 성인 2,127명 조사: 78.5% 가 AI 정보를 근거로 실생활 결정을 내린 적이 있고, 항상 검증한다는 응답은 17.4% 였습니다. (보도자료 기반 수치이며, 저는 원 조사기관의 방법론 문서를 확인하지 못했습니다.)
- TrustRadius 의 2026 B2B Buying Disconnect (2026년 1월 조사, 구매자 1,862명): AI 를 쓴 구매자의 94% 가 “적어도 가끔은” 사실 확인을 한다고 답했습니다.
두 수치는 모순이 아닙니다. “가끔 확인한다"와 “항상 확인한다” 사이의 간격이 바로 검증 병목 입니다. 그리고 사고는 항상 그 간격에서 납니다.
판정: 유지. 단, “비판적 사고력 전반"이 아니라 “검증"이라는 특정 지점으로 좁혀야 합니다.
② 사고의 평균화 — 결론은 맞고 이유는 틀렸습니다#
원문은 이렇게 설명했습니다.
LLM(대규모 언어 모델)은 확률적으로 가장 그럴듯한(Next Token Prediction) 답을 내놓습니다. 이는 곧 ‘가장 평균적이고 무난한’ 생각입니다.
결론은 2026년 데이터가 강하게 지지합니다. 그런데 괄호 안의 설명은 틀렸습니다.
붕괴는 사전학습이 아니라 정렬 단계에서 일어납니다#
Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras 가 2026년 4월에 공개한 「Where does output diversity collapse in post-training?」(arXiv 2604.16027)은 Olmo 3 계열 모델 세 종(Think / Instruct / RL-Zero)을 15개 태스크, 다양성 지표 4종으로 뜯어봤습니다.
핵심 발견은 두 가지입니다.
- 다양성 붕괴는 사후 학습(post-training) 단계에서 일어나고, 데이터 구성에 따라 그 지점이 달라집니다. Think 계열은 지도 미세조정(SFT)에서 의미적 다양성을 가장 많이 잃습니다.
- 붕괴는 가중치에 각인됩니다. 추론(reasoning) 을 추론 시점에 억제해도 답변 수준의 다양성은 보존되었습니다. 즉 생성 형식의 문제가 아니라 학습된 가중치의 문제이며, 추론 시점의 처방만으로는 되돌릴 수 없습니다.
flowchart LR
A["사전학습<br/>next-token prediction"] --> B["사후 학습<br/>SFT · DPO · RL"]
B --> C["추론 시점<br/>temperature · 프롬프트"]
A -.->|"원문이 지목한 범인"| X["평균적인 답"]
B ==>|"2026년 연구가 지목한 범인"| X
C -.->|"여기서는 되돌릴 수 없음"| X
style A fill:#D3D3D3,color:#000000
style B fill:#FF9999,color:#000000
style C fill:#D3D3D3,color:#000000
style X fill:#FFD700,color:#000000
왜 이 구분이 중요한가 하면, 처방이 완전히 달라지기 때문 입니다. “확률적 평균이라서 평균적"이라면 사용자는 손쓸 방법이 없습니다. “정렬 과정에서 좁혀졌고 가중치에 남았다"면, 이것은 모델 제작자가 데이터 구성으로 만든 선택 이고, 사용자 쪽에서도 여러 모델을 섞거나 다른 정렬 계보를 고르는 식으로 부분적으로 대응할 수 있습니다.
집단 차원에서는 더 심각합니다#
Trends in Cognitive Sciences 는 2026년 3월 11일, 서던캘리포니아대 Zhivar Sourati 를 제1저자로 하는 「The homogenizing effect of large language models on human expression and thought」를 게재했습니다. 언어학부터 컴퓨터과학까지 130편 이상 의 연구를 검토한 opinion paper 입니다.
이 논문이 정리한 것 중 원문이 놓친 것은 개인과 집단의 분리입니다.
- 개인 차원: LLM 을 쓰면 아이디어가 늘어납니다.
- 집단 차원: 같은 사람들이 LLM 을 쓰면 집단으로는 더 적고 덜 창의적인 아이디어 를 냅니다. 각자 따로 머리를 모을 때보다 못합니다.
- 편향된 LLM 과 대화한 뒤 사람들의 의견이 그 LLM 쪽으로 수렴 했습니다.
- 출력이 WEIRD(서구·교육받은·산업화·부유·민주주의) 사회의 언어와 가치, 추론 방식에 치우쳐 있습니다.
- LLM 은 선형적 추론을 선호 하고, 그 결과 직관적·추상적 추론의 사용이 줄어듭니다.
원문은 “세상은 세련되지만 뻔한 결과물로 가득 차게 될 것"이라고 썼습니다. 이 예측은 유지됩니다. 다만 손실의 단위가 개인이 아니라 집단 이라는 점이 빠졌습니다. 개인은 이득을 보면서 전체가 손해를 보는 구조는, 개인의 각성으로는 잘 멈추지 않습니다.
왜 안 멈추는가 — 평균화는 단기적으로 이득처럼 보입니다#
여기에 원문이 전혀 예상하지 못한 반전이 있습니다.
Paul Röttger, Kobi Hackenburg, Hannah Rose Kirk, Christopher Summerfield 가 2026년 4월에 공개한 「Measuring and Mitigating Persona Distortions from AI Writing Assistance」(arXiv 2604.22503)는 필자 2,939명과 독자 11,091명, 지각 차원 29종, 문단 1만 개 이상과 독자 평정 약 300만 건 규모의 실험입니다.
- AI 보조를 받은 글의 필자는 모든 차원에서 다르게 지각되었습니다. 더 단정적이고, 더 유능하고, 더 긍정적 으로 보였습니다.
- 지각되는 인구통계 프로필이 더 특권적인 집단 쪽으로 이동 했습니다.
- 그리고 후속 실험(참가자 8,798명)에서 독자는 AI 보조를 받은 필자를 더 신뢰했고 더 설득당했습니다. 왜곡이 클수록 더 그랬습니다.
- 보상 모델로 왜곡을 줄이자 사용자 수용도가 떨어졌습니다.
이것이 평균화가 멈추지 않는 이유입니다. 균질화는 손해로 체감되지 않습니다. 글쓴이에게는 유능해 보이는 이득으로, 읽는 사람에게는 신뢰할 만한 글로 체감됩니다. 대가는 집단 차원에서, 나중에, 아무도 청구서를 받지 않는 방식으로 지불됩니다.
판정: 수정. 결론은 유지하되 “next token prediction 이라서"라는 설명은 철회합니다. 그리고 손실의 단위를 개인에서 집단으로 옮겨야 합니다.
③ 주체성과 책임의 증발 — 이제 숫자가 있습니다#
원문은 “AI가 추천해서 샀어”, “AI가 코드를 이렇게 짜줬어” 같은 태도를 걱정했습니다. 6개월 전에는 정황이었습니다. 지금은 집계가 있습니다.
6개월 만에 1.9배#
법학 연구자 Damien Charlotin 이 관리하는 AI Hallucination Cases Database 는 법원이 명시적으로 “AI 가 지어낸 자료에 의존했다"고 인정하거나 시사한 판결 만 집계합니다. 주장만 있는 사건은 빼기 때문에, 이 숫자는 상한이 아니라 하한 입니다. 2026년 8월 20일 기준 누적 1,934건 입니다.
| 분기 | 누적 건수 |
|---|---|
| 2025 Q3 | 519 |
| 2025 Q4 | 920 |
| 2026 Q1 | 1,364 |
| 2026 Q2 | 1,770 |
| 2026 Q3 (진행 중) | 1,934 |
원문을 발행한 2026년 2월 직전 분기말이 920건이었습니다. 반년 만에 1.9배가 되었습니다.
몇 가지 세부가 더 중요합니다.
- 당사자 구성(2026 Q2): 변호사 38.5%, 본인소송(pro se) 60.2%. 이 문제는 전문직만의 문제가 아닙니다. 오히려 대리인 없이 법정에 서는 사람들 쪽이 더 많습니다.
- 결과: 금전 제재 352건, 징계 회부 150건.
- 내용 유형(항목 5,748개 기준): 날조 3,238 / 왜곡된 인용·표현 1,538 / 허위 인용문 937 / 낡은 조언 35.
- 관할: 미국 1,325, 캐나다 211, 호주 98, 영국 62, 이스라엘 55, 브라질 41. 한국도 4건 이 올라와 있습니다.
세 번째 항목을 눈여겨볼 만합니다. “없는 판례를 지어낸” 유형이 여전히 최다이지만, “있는 것을 잘못 옮긴” 유형이 1,538건 입니다. 존재하지 않는 사건명은 검색 한 번이면 잡힙니다. 실재하는 판결을 미묘하게 비틀어 인용한 것은 원문을 열어 대조해야 잡힙니다. 검증 비용이 훨씬 비싼 쪽으로 오류의 무게중심이 이동하고 있습니다.
책임이 사라지는 게 아니라 옆으로 굴러갑니다#
원문은 책임이 “흐려진다"고 표현했습니다. 실제로는 흐려지기보다 다른 사람에게 넘어갑니다.
BetterUp Labs 와 스탠퍼드 Social Media Lab 이 2025년 9월 Harvard Business Review 에 발표한 “workslop” 연구가 그 이동 경로를 계량합니다. 2025년 자료 이며, 미국 정규직 1,150명 설문입니다.
- 41% 가 최근 한 달 안에 workslop — 그럴듯해 보이지만 일을 진전시키지 못하는 AI 산출물 — 을 받았습니다.
- 받은 사람은 건당 평균 1시간 56분 을 썼습니다.
- 1인당 월 $186, 1만 명 조직 기준 연 900만 달러 이상입니다.
- 받은 사람의 42% 가 보낸 사람을 덜 신뢰하게 되었다 고 답했고, 33% 는 다시 같이 일하고 싶지 않다고 했습니다.
보낸 사람 입장에서는 시간을 아꼈습니다. 아낀 시간은 사라진 게 아니라 받는 사람의 두 시간으로 옮겨갔습니다. 그리고 옮겨간 만큼 신뢰가 깎였습니다. 원문이 “직업 윤리와 주체성의 약화"라고 추상적으로 쓴 것의 실체가 이겁니다.
판정: 유지. 6개월 전에는 우려였고 지금은 집계입니다.
④ 환각의 무비판적 수용 — 초점을 옮겨야 합니다#
원문은 “AI는 사실 여부와 관계없이 유창하게 말하는 데 최적화되어 있다"고 썼습니다. 이 문장은 2026년에도 참입니다. 그런데 이 문장에 초점을 맞추는 순간 문제를 놓칩니다.
모델은 좋아졌습니다#
뉴스 영역의 대표 측정치를 보겠습니다. 둘 다 2025년 자료 입니다.
- BBC 2025년 2월 조사: AI 답변의 51% 에 유의미한 문제가 있었습니다.
- 유럽방송연맹(EBU)과 BBC 가 주도한 2025년 10월 「News Integrity in AI Assistants」 — 18개국 22개 공영방송, 14개 언어, 응답 3,000건 이상을 직업 기자가 평가 — 에서는 45% 로 내려왔습니다. 출처 문제 31%, 중대한 정확도 문제 20%.
여덟 달 만에 6%p 개선입니다. 느리지만 방향은 맞습니다.
그런데 사고는 두 배가 되었습니다#
같은 기간 Charlotin DB 의 누적 건수는 920건에서 1,770건으로 늘었습니다. 모델의 오류율은 내려갔는데 오류로 인한 사고는 늘었습니다.
산수는 단순합니다. 오류율이 6%p 내려가는 동안 사용량이 그보다 훨씬 크게 늘었고, 검증 관행은 그만큼 늘지 않았습니다. Gallup 이 2026년 2분기(2026-05-06~05-20, 미국 취업자 22,573명)에 측정한 수치를 보면 미국 직장인의 52% 가 업무에 AI 를 쓰고, 30% 가 주 수회 이상, 15% 가 매일 씁니다. 직전 측정인 2025년 4분기(51% / 26% / 12%)에서 완만하게 올랐습니다.
그러니까 정확한 진술은 이렇습니다.
2026년의 문제는 AI 가 자주 틀린다는 것이 아니라, 덜 틀리게 되었기 때문에 아무도 확인하지 않는다는 것입니다.
이것은 원문이 4번 문제에서 말한 것과 미묘하게 다릅니다. 원문은 사용자가 “귀찮아서” 팩트체크를 생략한다고 봤습니다. 실제 메커니즘은 게으름이 아니라 경험에 기반한 합리적 신뢰 입니다. 열 번 맞은 도구를 열한 번째에 의심하는 것은 인지적으로 자연스럽지 않습니다. 그래서 모델이 좋아질수록 이 문제는 완화되는 게 아니라 강화됩니다.
판정: 수정. “AI 가 유창하게 거짓말한다"에서 “정확도가 올라갈수록 검증이 사라진다"로 초점을 옮겨야 합니다.
인용하지 않기로 한 자료 하나#
이 주제에서 가장 널리 인용되는 연구는 MIT Media Lab 의 「Your Brain on ChatGPT」(2025년 6월, arXiv 2506.08872)입니다. EEG 로 뇌 연결성을 측정해 “인지적 부채(cognitive debt)“라는 표현을 만들어 낸 연구이고, 국내외 기사에서 “AI 쓰면 뇌 활동 47% 감소” 같은 제목으로 수없이 재생산되었습니다.
저는 이 연구를 근거로 쓰지 않기로 했습니다. 이유는 이렇습니다.
- 참가자가 54명 이고, 핵심 주장이 나온 세션 4 의 참가자는 18명 입니다.
- 동료 심사를 거치지 않은 프리프린트 입니다. 저자들 스스로 결과가 예비적이라고 밝혔고, 정책 결정이 6~8개월 안에 이뤄질 것을 우려해 심사 전에 공개했다고 설명했습니다.
- 그럼에도 언론은 인과적이고 확정적인 표현으로 옮겼습니다.
방향 자체는 다른 연구들과 어긋나지 않습니다. 다만 이 정도 표본으로 이 정도 강한 주장을 뒷받침할 수는 없습니다. 그리고 사고의 외주화를 걱정하는 글이 검증 없이 유명한 숫자를 가져다 쓰는 것만큼 자기모순적인 일도 없을 것입니다.
정리#
- 전제는 유지되지만 무조건절은 조건절이 되어야 합니다. AI 가 사고력을 퇴화시키는 것이 아니라, 구조 없이 쓰는 AI 가 퇴화시킵니다. CHI 메타분석의 전체 효과크기는 1.34 로 크게 긍정적이고, 다만 고차 사고에서 줄어듭니다.
- 근손실은 사고력 전반이 아니라 검증이라는 한 지점에서 일어납니다. 정확도가 가장 낮은 어려운 과제에서 의존이 가장 높고(73.9%), 바로 거기서 확신과 성과의 격차가 34.6%p 로 벌어집니다.
- 평균화는 사실이지만 원문이 지목한 범인이 틀렸습니다. 다양성 붕괴는 사전학습의 next-token prediction 이 아니라 사후 학습 단계에서 일어나고 가중치에 각인됩니다.
- 평균화의 손실 단위는 개인이 아니라 집단입니다. 개인은 아이디어가 늘고 유능해 보이며 독자에게 더 신뢰받습니다. 그래서 개인의 각성으로는 잘 멈추지 않습니다.
- 책임 문제는 우려에서 집계로 넘어왔습니다. 법원이 인정한 AI 환각 사건은 반년 만에 1.9배가 되었고, 그중 60%는 변호사가 아니라 본인소송 당사자입니다.
- 환각 문제의 초점은 이동해야 합니다. 모델의 오류율은 내려갔고(51% → 45%), 사고 건수는 두 배가 되었습니다. 문제는 모델이 아니라 검증 관행입니다.
Part 2 에서는 원문이 제시한 네 가지 액션 플랜을 같은 방식으로 채점하겠습니다. 하나는 예상보다 훨씬 잘 버텼고, 하나는 폐기해야 하며, 하나는 전제 자체가 낡았습니다.
References#
2026년 자료
- Liu, G., Christian, B., Dumbalska, T., Bakker, M. A., & Dubey, R. (2026, April 6). AI Assistance Reduces Persistence and Hurts Independent Performance. arXiv:2604.04721. https://arxiv.org/abs/2604.04721 — 프리프린트. 무작위 대조 실험 3건, 참가자 1,222명.
- Rismanchian, S., Uzun, H., Matayoshi, J., Cosyn, E., & Kurd-Misto, E. (2026, May 20). Faster Completion, Less Learning. arXiv:2605.21629. https://arxiv.org/abs/2605.21629 — 프리프린트. ALEKS 상호작용 320만 건, 준실험 설계.
- Huemmer, M., Durner, F., Shyiramunda, T., & Cummings-Koether, M. J. (2026, January 21). AI, Metacognition, and the Verification Bottleneck: A Three-Wave Longitudinal Study of Human Problem-Solving. arXiv:2601.17055. https://arxiv.org/abs/2601.17055 — 프리프린트. 종단 자가보고. 저자들이 표본 동질성과 무작위 통제 부재를 한계로 명시했습니다.
- Karouzos, C., Tan, X., & Aletras, N. (2026, April 17). Where does output diversity collapse in post-training? arXiv:2604.16027. https://arxiv.org/abs/2604.16027 — 프리프린트. Olmo 3 계열 3종, 15개 태스크.
- Sourati, Z., et al. (2026, March 11). The homogenizing effect of large language models on human expression and thought. Trends in Cognitive Sciences. https://www.sciencedirect.com/science/article/abs/pii/S1364661326000033 — 동료 심사 저널의 opinion paper. 130편 이상 검토. 요약은 EurekAlert 보도자료로 확인했습니다.
- Röttger, P., Hackenburg, K., Kirk, H. R., & Summerfield, C. (2026, April 24). Measuring and Mitigating Persona Distortions from AI Writing Assistance. arXiv:2604.22503. https://arxiv.org/abs/2604.22503 — 프리프린트. 필자 2,939명, 독자 11,091명.
- Charlotin, D. AI Hallucination Cases Database. https://www.damiencharlotin.com/hallucinations/ — 개인 연구자가 관리하는 큐레이션 DB. 2026-08-20 접속, 누적 1,934건. 법원이 명시적으로 인정한 건만 집계하므로 하한선입니다.
- Gallup. (2026). Organizational AI Adoption Jumps Six Points. https://www.gallup.com/workplace/712736/organizational-adoption-jumps-six-points.aspx — 조사 2026-05-06~05-20, 미국 취업자 22,573명, 오차 ±1.0%p.
- Lenharo, M. (2026, June 18). Is AI ruining our skills? Early results are in — and they’re not good. Nature 655, 15–16. https://www.nature.com/articles/d41586-026-01947-1 — 본문은 유료입니다. 표제·부제와 참고문헌 목록만 확인했습니다.
- Generative AI Tools in Higher Education: A Meta-Analysis of Cognitive Impact. CHI Extended Abstracts. https://dl.acm.org/doi/10.1145/3706599.3719841 — 전체 효과크기 1.34 (95% CI 1.17~1.50).
- The cognitive impact of ChatGPT in higher education: A systematic review of critical and creative thinking outcomes. Computers and Education: Artificial Intelligence (2026). https://www.sciencedirect.com/science/article/pii/S2666920X26000330 — 2022~2025년 실증 연구 67편 PRISMA 리뷰.
비교·배경 자료 (발표 연도를 함께 적습니다)
- Lee, H.-P., Sarkar, A., Tankelevitch, L., et al. (2025). The Impact of Generative AI on Critical Thinking. CHI 2025. https://www.microsoft.com/en-us/research/wp-content/uploads/2025/01/lee_2025_ai_critical_thinking_survey.pdf — 2025년 자료. 자가보고 설문, 지식노동자 319명.
- European Broadcasting Union & BBC. (2025, October 21). News Integrity in AI Assistants. https://www.ebu.ch/research/open/report/news-integrity-in-ai-assistants — 2025년 자료. 2026년에는 평가 툴킷이 공개되었으나 새로운 헤드라인 수치는 확인하지 못했습니다.
- Niederhoffer, K., Kellerman, G. R., Lee, A., et al. (2025, September 22). AI-Generated “Workslop” Is Destroying Productivity. Harvard Business Review. https://hbr.org/2025/09/ai-generated-workslop-is-destroying-productivity — 2025년 자료. BetterUp Labs × 스탠퍼드 Social Media Lab, 미국 정규직 1,150명 설문.
- Kosmyna, N., et al. (2025, June). Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task. arXiv:2506.08872. https://arxiv.org/abs/2506.08872 — 2025년 프리프린트. 참가자 54명, 세션 4 는 18명. 본문에서 근거로 채택하지 않은 이유를 밝혔습니다.
- Budzyń, K., et al. (2025). Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre, observational study. The Lancet Gastroenterology & Hepatology 10, 896–903. https://pubmed.ncbi.nlm.nih.gov/40816301/ — 2025년 자료. 관찰 연구이며 무작위 배정이 아닙니다.