사고의 외주화, 6개월 후 Part 3: 원문이 예상하지 못한 것들
이 글은 Claude Opus 5 를 이용해 초안이 작성되었으며, 이후 퇴고를 거쳤습니다.
Part 1에서 진단을, Part 2에서 처방을 채점했습니다. 이번 편은 채점표에 없던 항목들입니다. 원문이 6개월 전에는 예상하지 못했거나, 예상했더라도 규모를 몰랐던 것들 입니다.
그리고 마지막으로 원문의 결론 — Co-pilot 인가 Autopilot 인가 — 을 다룹니다. 이 이분법은 2026년 8월 현재 성립하지 않습니다.
새 그림자 ①: 사고의 외주화에서 실행의 외주화로#
원문이 걱정한 것은 판단 의 외주화였습니다. 무엇을 할지, 어떻게 접근할지, 이게 맞는지를 AI 에게 맡기는 것. 그 그림에는 암묵적인 전제가 하나 있습니다. 결과물을 받아 보는 시점이 존재한다 는 것입니다.
에이전트는 그 시점을 없앱니다.
Anthropic 이 2026년 6월에 발표한 Economic Index 「Cadences」 보고서의 수치입니다. 벤더 자체 텔레메트리 라는 점을 먼저 밝힙니다.
- AI 자율성(autonomy)은 1~5 척도로 평가되며, Claude Code 세션은 채팅보다 평균 0.37 포인트 높았습니다.
- 그 격차의 약 3분의 2는 모델이나 제품 성능 차이가 아니라 사용자가 같은 과제를 더 많이 위임하기 때문 이었습니다.
- 보고서의 한 문장이 이 변화를 압축합니다. “블로그 글이나 기사를 만드는 채팅·Cowork 대화의 중앙값은 13라운드의 주고받기인 반면, 블로그를 만드는 Claude Code 세션의 중앙값은 사람의 프롬프트 한 번이다.”
같은 산출물, 같은 사람, 13번의 개입과 1번의 개입. 표면(surface)이 바뀌면 사람의 개입 횟수가 이렇게 바뀝니다.
“사고의 외주화"라는 표현은 이제 부정확합니다. 2026년에 실제로 일어나는 것은 사고와 실행이 함께 나가고, 사람은 결과 앞에서만 잠깐 서는 것 입니다. 원문의 액션 플랜 중 “AI 가 생성한 결과물을 그대로 복사+붙여넣기 하지 말라"는 조언은, 복사할 것도 붙여넣을 것도 없이 이미 파일이 고쳐지고 커밋이 올라간 환경에서는 실행할 자리가 없습니다.
반대 방향 근거도 함께 놓겠습니다#
정직하게 덧붙여야 할 것이 있습니다. 같은 회사의 다른 보고서는 반대 방향 을 가리킵니다.
2026년 3월 「Learning curves」 보고서에 따르면, 6개월 이상 쓴 사용자는 성공률이 10% 높았고, 경력이 쌓일수록 지시형(directive) 위임을 줄이고 검증·학습형 상호작용을 늘렸습니다. 그리고 6월 보고서는 이렇게 적었습니다. “위임을 많이 하는 사용자도 다른 사람들과 같은 속도로 학습한다고 보고한다.”
다만 Anthropic 자신이 바로 다음 문장에서 단서를 답니다. “이것은 자기평가이며, 어떤 사람이 더 많이 배우고 있다고 보고하는 와중에도 기술은 침식될 수 있으므로, 이 데이터가 기술 침식을 배제하지는 않는다.”
이 단서가 Part 1·2 에서 본 통제 실험들과의 관계를 정리해 줍니다.
| 무엇을 재는가 | 결과 |
|---|---|
| 사용자의 자기평가 (Anthropic 2026) | 위임을 많이 해도 학습감은 동일 |
| 도구를 치운 뒤의 실제 수행 (Liu et al. 2026, Bastani et al. 2025) | 유의하게 낮음 |
| 방금 쓴 코드에 대한 개념 퀴즈 (Shen & Tamkin 2026) | 50% 대 67% |
세 결과는 모순이 아닙니다. 자기평가와 실측이 갈라지는 것 자체가 이 문제의 핵심 증상 입니다. Part 1 에서 본 확신-성과 격차 34.6%p 와 같은 현상입니다.
새 그림자 ②: 검증이 병목이 되었고, 병목은 사람을 늘려서 풀리지 않습니다#
생성 비용은 0 에 수렴했습니다. 검증 비용은 그대로입니다. 이 비대칭이 6개월 사이 조직 안에서 눈에 보이는 형태로 나타났습니다.
- Part 1 에서 본 workslop 조사(2025년 자료, 미국 정규직 1,150명): 받은 사람이 건당 1시간 56분.
- Part 1 에서 본 검증 역설(2026년 종단 연구): 정확도가 가장 낮은 어려운 과제에서 의존이 가장 높고(73.9%), 검증 자신감은 낮습니다.
여기에 6개월 사이 나빠진 요인이 하나 더 있습니다. 오류의 종류가 바뀌었습니다.
Charlotin DB 에 집계된 항목 5,748개의 유형 분포를 다시 보겠습니다.
| 유형 | 건수 | 검증 비용 |
|---|---|---|
| 날조 (없는 것을 만듦) | 3,238 | 낮음 — 검색 한 번 |
| 왜곡 (있는 것을 잘못 옮김) | 1,538 | 높음 — 원문 대조 필요 |
| 허위 인용문 | 937 | 높음 — 원문 대조 필요 |
| 낡은 조언 | 35 | 중간 |
존재하지 않는 판례명은 검색 한 번이면 걸립니다. 실재하는 판결을 미묘하게 비틀어 인용한 것은 원문을 열어 문장을 대조해야 걸립니다. 모델이 좋아지면서 남는 오류가 검증하기 어려운 쪽으로 몰립니다.
그래서 “사람이 확인하면 된다"는 해법은 산술적으로 성립하지 않습니다. 생성량은 배로 늘고, 건당 검증 비용은 오르고, 검증할 수 있는 사람의 수는 그대로입니다.
새 그림자 ③: 개인 최적과 집단 최적이 갈라졌습니다#
이것이 6개월 사이 제 생각을 가장 많이 바꾼 항목입니다.
원문은 사고의 외주화를 개인의 손해 로 그렸습니다. 내가 덜 생각하면 내 사고력이 퇴화한다는 구조입니다. 그렇다면 처방은 개인의 각성으로 충분합니다. 원문의 액션 플랜 네 개가 전부 개인 습관인 것도 그 때문입니다.
2026년 자료는 다른 구조를 보여 줍니다.
- Trends in Cognitive Sciences 2026년 3월 리뷰(130편 이상 검토): 개인은 LLM 으로 아이디어가 늘지만, 집단은 LLM 을 쓸 때 각자 머리를 모을 때보다 더 적고 덜 창의적인 아이디어를 냅니다.
- Röttger 등의 2026년 4월 실험(필자 2,939명, 독자 11,091명): AI 보조를 받은 필자는 더 유능해 보이고, 독자는 그 글을 더 신뢰하고 더 설득당합니다.
두 결과를 겹치면 이렇게 됩니다. 개인에게는 이득이고 집단에게 손해입니다. 그리고 이득은 즉시, 개인에게, 눈에 보이게 옵니다. 손해는 나중에, 집단에게, 아무도 청구서를 받지 않는 방식으로 옵니다.
이 구조에서는 “각자 조심합시다"가 작동하지 않습니다. 조심하는 사람만 손해를 보기 때문입니다. Part 2 에서 정리한 개인 규칙들은 여전히 유효하지만, 그것만으로는 부족하다는 것이 6개월 사이 분명해진 부분 입니다. 팀 단위의 규범 — 무엇을 검증하고 무엇을 검증하지 않을지, AI 사용을 어떻게 표시할지, 리뷰의 기준을 어디에 둘지 — 이 개인 습관보다 위에 있어야 합니다.
새 그림자 ④: 제도의 시계가 뒤로 갔습니다#
2026년 2월에 글을 쓸 때 저는 규제 이야기를 하지 않았습니다. 할 필요가 없다고 생각했습니다. EU AI Act 의 고위험 시스템 의무가 2026년 8월 2일에 발효될 예정 이었기 때문입니다. 그때가 되면 최소한 고위험 영역에서는 인간 감독(Article 14)이 법적 요구사항이 될 참이었습니다.
그 날짜가 지나갔고, 발효되지 않았습니다.
2026년 6월 29일 EU 이사회가 Digital Omnibus 를 최종 승인하면서 일정이 밀렸습니다.
| 대상 | 원래 시점 | 변경된 시점 |
|---|---|---|
| Annex III 독립형 고위험 시스템 | 2026-08-02 | 2027-12-02 (16개월 연기) |
| Annex I 규제 제품 내장형 | 2027-08-02 | 2028-08-02 (12개월 연기) |
| Article 50 투명성 의무 | 2026-08-02 | 연기 없음. 그대로 발효 |
연기된 것은 시점이지 내용이 아닙니다. 위험 관리 체계, 기술 문서, 인간 감독 절차, 기본권 영향평가 요구는 삭제되지 않았습니다. 연기의 실무적 배경은 준비 부족이었습니다. 2026년 3월 기준 27개 회원국 중 8개국만 소관 당국 지정을 마쳤습니다.
여기서 끌어낼 결론은 규제 찬반이 아닙니다. 사실 관계 하나입니다.
앞으로 최소 1년 반 동안, 고위험 영역에서조차 검증을 강제하는 것은 법이 아니라 조직의 내부 규율입니다.
원문이 “주체성"이라고 부른 것이 실제로 요구되는 기간이 예상보다 길어졌습니다.
새 그림자 ⑤: 이 문제는 전문직 밖에서 더 큽니다#
원문은 지식노동자를 독자로 상정했습니다. 개발자, 기획자, 글 쓰는 사람. 그런데 Part 1 에서 본 Charlotin DB 의 당사자 구성이 그 상정을 흔듭니다.
2026년 2분기 기준 변호사 38.5%, 본인소송(pro se) 60.2%.
법원 판결에 이름이 남을 만큼 크게 실패한 AI 사용의 다수는 변호사 없이 혼자 법정에 선 사람들 입니다. 이들에게는 조언해 줄 선배도, 팀 규범도, 리뷰어도 없습니다. 검증 능력이 가장 부족한 사람이 검증 부담을 전부 지는 구조입니다.
한국도 예외가 아닙니다. 같은 DB 에 한국 관련 판결이 4건 올라와 있습니다. 그리고 한국직업능력연구원이 2025년에 대학생 726명 을 조사한 결과(한국대학신문 2026년 신년기획 보도), 91.7%가 학습에 AI 를 활용 하고 84.2%가 계속 쓸 의향이라고 답했습니다. 같은 기사에 실린 학부생 인터뷰 중 한 문장이 원문의 주제를 정확히 요약합니다.
“AI로 결과가 비슷하게 나오니 스스로 글쓰기를 연습할 이유가 사라졌다.”
Part 2 에서 정리한 처방들은 검증 능력이 이미 있는 사람 을 전제합니다. 그 전제가 없는 사람에게 무엇을 말할 수 있는지는, 솔직히 말해 저도 답을 갖고 있지 않습니다. 다만 이 문제가 “AI 를 잘 쓰는 지식노동자"의 문제가 아니라는 것만은 6개월 사이 분명해졌습니다.
결론 재작성: Co-pilot / Autopilot 이분법은 깨졌습니다#
원문의 마지막은 이랬습니다.
AI는 훌륭한 부조종사(Co-pilot) 입니다. 하지만 조종간을 완전히 넘겨버리고 자동 조종(Autopilot) 모드로 잠들어버린다면, 우리는 목적지를 잃은 승객으로 전락할 것입니다.
이 비유의 원조는 Lisanne Bainbridge 가 1983년 Automatica 에 쓴 「Ironies of Automation」입니다. 43년 된 논문 이지만 이 주제의 골격을 여전히 가장 잘 설명합니다. 요지는 이렇습니다. 자동화가 진행될수록 사람에게 남는 일은 감시와 예외 처리 인데, 바로 그 일이 가장 높은 숙련을 요구하고, 자동화 때문에 그 숙련을 연습할 기회가 사라진다는 것입니다.
2026년의 문제는 이 비유가 틀려서가 아니라 좌석 배치가 바뀌어서 입니다.
조종석에는 두 자리가 있습니다. 부조종사냐 자동조종이냐를 물으려면 조종간이 하나여야 합니다. 그런데 지금 개발자 한 사람이 에이전트 세 개를 동시에 돌리고, 각각이 다른 브랜치에서 파일을 고치고 있습니다. Anthropic 의 수치대로라면 그중 하나는 프롬프트 한 번 뒤로 사람의 개입이 없습니다.
이건 조종석이 아니라 관제탑 입니다. 그리고 관제탑에서 물어야 할 질문은 다릅니다.
flowchart LR
H0[" "]:::hdr
H1["결과를 검증할 수 있다"]:::hdr
H2["검증할 수 없다"]:::hdr
R1["단계마다 개입한다"]:::hdr
A["부조종사<br/><br/>느리지만 안전<br/>숙련이 유지됨"]
B["시간만 쓴다<br/><br/>개입해도 판정 불가<br/>가장 비싼 칸"]
R2["결과만 받는다"]:::hdr
C["관제탑<br/><br/>지속 가능하지만<br/>검증이 병목"]
D["자동 조종<br/><br/>사고가 나야<br/>알게 됨"]
H0 ~~~ H1 ~~~ H2
R1 ~~~ A ~~~ B
R2 ~~~ C ~~~ D
classDef hdr fill:none,stroke:none,color:#dddddd
style A fill:#90EE90,color:#000000
style B fill:#FFD700,color:#000000
style C fill:#87CEEB,color:#000000
style D fill:#FF9999,color:#000000
원문은 왼쪽 열 안에서 위아래를 고르라고 했습니다. 실제로 결정적인 것은 가로축입니다. 검증할 수 없는 상태에서는 개입을 많이 하든 적게 하든 결과가 같습니다. 개입을 많이 하면 시간만 더 쓸 뿐입니다.
그래서 2026년에 던져야 할 질문은 “부조종사인가 자동조종인가"가 아닙니다.
지금 몇 대를 띄워 놓았고, 그중 내려앉는 것을 실제로 판정할 수 있는 것은 몇 대인가.
이 질문에는 정답이 없습니다. 다만 두 숫자가 벌어질수록 위험하다는 것만은 확실하고, 두 숫자를 세어 보는 일은 오늘 할 수 있습니다.
전체 정리: 6개월 채점표#
| # | 원문의 주장 | 판정 | 2026년에 바뀐 것 |
|---|---|---|---|
| 전제 | 고민을 건너뛰면 성장도 건너뛴다 | ✅ 유지 (조건절) | 무조건적 퇴화가 아니라 구조 없는 사용 이 퇴화시킴 |
| ① | 비판적 사고력의 근손실 | ✅ 유지 (범위 축소) | 사고력 전반이 아니라 검증 이라는 한 지점 |
| ② | 사고의 평균화 | ⚠️ 수정 | 범인은 next-token 이 아니라 사후 학습. 손실 단위는 개인이 아니라 집단 |
| ③ | 주체성과 책임의 증발 | ✅ 유지 (강화) | 우려에서 집계 로. 반년 만에 1.9배 |
| ④ | 환각의 무비판적 수용 | ⚠️ 수정 | 모델은 개선됨. 문제는 정확도가 올라서 아무도 안 본다 는 것 |
| A1 | 초안은 내가 쓴다 | ✅ 유지 | 기준이 “5분"에서 “단계” 로 |
| A2 | 30% 수정 룰 | ❌ 폐기 | 근거 없음. 질문 형식 + 검증 지점 4종 으로 대체 |
| A3 | 고유성 주입 | ⚠️ 수정 | “AI 는 내 맥락을 모른다"는 전제가 무너짐 |
| A4 | 의도적 불편 | ✅ 유지 (처방 변경) | 금식보다 가드레일. 금식은 훈련이 아니라 진단 으로 |
| 결론 | Co-pilot vs Autopilot | ❌ 폐기 | 이분법이 아니라 위임 × 검증 가능성 의 2차원 |
| — | (없던 항목) | 🆕 | 실행의 외주화, 검증 병목, 개인·집단 괴리, 규제 연기, 전문직 밖 확산 |
6개월 뒤에 다시 확인할 것들#
이 시리즈의 근거도 6개월이면 흔들립니다. 다음 재검증 때 제가 먼저 열어 볼 것들을 적어 둡니다.
- Liu et al. 2604.04721 의 동료 심사 통과 여부. 이 시리즈에서 가장 무겁게 쓴 근거인데 아직 프리프린트입니다. 심사 과정에서 효과 크기가 줄어들 수 있습니다.
- Charlotin DB 의 2026 Q3·Q4 수치. Q1 444건 → Q2 406건으로 분기 증가분이 처음으로 꺾였습니다. 포화인지 일시적 변동인지는 두 분기를 더 봐야 압니다.
- 본인소송 비율. 60%가 유지되면 이 문제의 무게중심은 완전히 전문직 밖입니다.
- Digital Omnibus 이후의 자율 규범. 법이 1년 반 미뤄진 자리를 산업 자율 규범이 메우는지, 아니면 비는지.
- Anthropic 자가보고와 통제 실험의 간격. 이 간격이 좁혀지는지가 “기술 침식” 가설의 실질적 시험대입니다.
- 다양성 붕괴의 완화 시도. 사후 학습 단계에서 다양성을 보존하려는 방법들이 실제 제품 모델에 들어가는지.
마지막으로 하나. 이 시리즈를 쓰면서 가장 오래 걸린 작업은 글을 쓰는 것이 아니라 수치를 원문에서 확인하는 것 이었습니다. 인용문 하나를 대조하는 데 걸린 시간이 문단 하나를 쓰는 시간보다 길었습니다.
Part 1 에서 정리한 대로 6개월 전 원문에는 근거가 하나도 없었습니다. 그 글은 30분이면 만들 수 있었을 것입니다. 그 차이가 곧 검증 병목의 크기입니다. 그리고 이 병목은 앞으로도 줄지 않을 것 같습니다.
References#
2026년 자료
- Anthropic. (2026, June). Anthropic Economic Index report: Cadences. https://www.anthropic.com/research/economic-index-june-2026-report — 벤더 자체 텔레메트리. 자율성 1~5 척도, 평균 격차 0.37 포인트. 자기평가 학습률에 대한 저자들의 단서를 본문에 함께 인용했습니다.
- Anthropic. (2026, March). Anthropic Economic Index report: Learning curves. https://www.anthropic.com/research/economic-index-march-2026-report — 벤더 자체 텔레메트리.
- Charlotin, D. AI Hallucination Cases Database. https://www.damiencharlotin.com/hallucinations/ — 2026-08-20 접속. 누적 1,934건, 항목 5,748개. 법원이 명시적으로 인정한 건만 집계하는 하한선입니다.
- Sourati, Z., et al. (2026, March 11). The homogenizing effect of large language models on human expression and thought. Trends in Cognitive Sciences. https://www.sciencedirect.com/science/article/abs/pii/S1364661326000033
- Röttger, P., Hackenburg, K., Kirk, H. R., & Summerfield, C. (2026, April 24). Measuring and Mitigating Persona Distortions from AI Writing Assistance. arXiv:2604.22503. https://arxiv.org/abs/2604.22503 — 프리프린트.
- Liu, G., Christian, B., Dumbalska, T., Bakker, M. A., & Dubey, R. (2026, April 6). AI Assistance Reduces Persistence and Hurts Independent Performance. arXiv:2604.04721. https://arxiv.org/abs/2604.04721 — 프리프린트.
- Huemmer, M., et al. (2026, January 21). AI, Metacognition, and the Verification Bottleneck. arXiv:2601.17055. https://arxiv.org/abs/2601.17055 — 프리프린트.
- Shen, J. H., & Tamkin, A. (2026, February). How AI assistance impacts the formation of coding skills. Anthropic. https://www.anthropic.com/research/AI-assistance-coding-skills — 벤더 자체 연구.
- EU Digital Omnibus 관련 일정은 로펌 해설로 교차 확인했습니다. Gibson Dunn, DLA Piper, Travers Smith — 이사회 최종 승인 2026-06-29, Annex III 고위험 의무 2027-12-02 로 연기, Article 50 투명성 의무는 2026-08-02 그대로.
- 한국대학신문. (2026 신년기획). 「공부는 쉬워지고 사고의 필요성은 줄었다」 — 인용된 조사는 한국직업능력연구원의 2025년 대학생 726명 조사 입니다.
비교·배경 자료 (발표 연도를 함께 적습니다)
- Bainbridge, L. (1983). Ironies of Automation. Automatica 19(6), 775–779. https://ckrybus.com/static/papers/Bainbridge_1983_Automatica.pdf — 43년 된 고전 문헌입니다.
- Bastani, H., et al. (2025). Generative AI without guardrails can harm learning. PNAS. https://www.pnas.org/doi/10.1073/pnas.2422633122 — 2025년 자료. 동료 심사.
- Niederhoffer, K., et al. (2025, September 22). AI-Generated “Workslop” Is Destroying Productivity. Harvard Business Review. https://hbr.org/2025/09/ai-generated-workslop-is-destroying-productivity — 2025년 자료.