사고의 외주화, 6개월 후 Part 2: 액션 플랜 네 개를 다시 씁니다
이 글은 Claude Opus 5 를 이용해 초안이 작성되었으며, 이후 퇴고를 거쳤습니다.
Part 1에서는 원문의 진단 네 가지를 2026년 자료로 채점했습니다. 두 개는 유지, 두 개는 수정이었습니다. 이번 편은 처방 — 원문이 제시한 네 가지 액션 플랜입니다.
진단보다 처방을 채점하기가 훨씬 어렵습니다. 진단은 “그런 일이 일어나는가"만 물으면 되지만, 처방은 “그렇게 하면 나아지는가"를 물어야 하고, 그런 실험은 훨씬 적기 때문입니다. 그래도 6개월 사이 몇 개가 나왔습니다. 그리고 그 몇 개가 원문의 네 가지 중 두 개를 살리고 두 개를 무너뜨립니다.
| 원문의 액션 | 판정 |
|---|---|
| 1. 빈 화면의 법칙 — 초안은 내가 쓴다 | 유지. 네 개 중 가장 잘 버텼습니다 |
| 2. 인턴 사원 마인드셋 — 30% 수정 룰 | 폐기. 근거가 없고, 반대 방향 증거가 있습니다 |
| 3. 고유성 주입 — “AI 는 어제 내 일을 모른다” | 수정. 전제가 낡았습니다 |
| 4. 의도적인 불편 즐기기 | 유지, 처방 변경. 금식보다 가드레일입니다 |
먼저: 2026년 데이터가 가리키는 단일 변수#
네 개를 하나씩 보기 전에, 6개월 사이 나온 연구들이 약속이라도 한 듯 같은 지점을 가리켰다 는 사실을 먼저 적어야겠습니다.
세 연구입니다. 대상도, 과제도, 국가도, 연구 그룹도 다릅니다.
| 연구 | 대상 | 갈라진 지점 | 결과 |
|---|---|---|---|
| Liu et al. 2026 (RCT, n=1,222) | 미국 성인, 분수·독해 | 직접 답 요구 vs 힌트 요구 | 직접 답 요구 쪽만 성능 급락, 포기 약 2배 |
| Shen & Tamkin 2026 (Anthropic, n=52) | 주니어 엔지니어, 낯선 라이브러리 | 코드 생성 위임 vs 개념 질문 | 40% 미만 vs 65% 이상 (개념 퀴즈) |
| Bastani et al. 2025 (PNAS, 약 1,000명) | 튀르키예 고교생, 수학 | 무제한 GPT vs 튜터형 GPT | 시험에서 −17% vs 효과 거의 소멸 |
Bastani 등의 연구는 특히 선명합니다. 연습 문제를 푸는 동안에는 무제한 GPT 그룹이 통제군보다 48% 잘했고, 튜터형(직접 답을 주지 않고 유도하는) 그룹은 127% 잘했습니다. 그런데 AI 를 치우고 시험을 보자 무제한 그룹은 통제군보다 17% 못했고, 튜터형 그룹에서는 그 손해가 거의 사라졌습니다. PNAS 에 실린 동료 심사 논문이고, 제목이 「Generative AI without guardrails can harm learning」입니다. 가드레일이 제목에 들어간 이유가 이겁니다.
flowchart TB
Q["같은 모델, 같은 시간,<br/>같은 과제"] --> A["답을 요구한다<br/>'이거 해 줘'"]
Q --> B["과정을 요구한다<br/>'어떻게 접근하지'<br/>'이 개념이 뭐지'"]
A --> A1["즉시 성과 ↑↑"]
B --> B1["즉시 성과 ↑"]
A1 --> A2["도구를 치우면<br/>통제군보다 낮음"]
B1 --> B2["도구를 치워도<br/>통제군 수준 유지"]
style A fill:#FF9999,color:#000000
style B fill:#90EE90,color:#000000
style A2 fill:#FF9999,color:#000000
style B2 fill:#90EE90,color:#000000
style Q fill:#87CEEB,color:#000000
원문의 액션 플랜은 얼마나 개입할 것인가 를 다뤘습니다. 5분 먼저 생각하기, 30% 고치기, 주 1회 끊기 — 전부 양의 문제입니다. 2026년 데이터가 가리키는 것은 양이 아니라 형식 입니다. 무엇을 물었는가.
이 기준으로 네 개를 다시 봅니다.
Action 1. 빈 화면의 법칙 — 유지, 그리고 더 정확해졌습니다#
원문의 조언은 이랬습니다.
AI에게 질문하기 전에, 최소 5분은 스스로 목차를 잡거나 핵심 키워드를 나열해 봅니다. 개발자라면 의사코드(Pseudo-code)나 아키텍처 다이어그램을 먼저 그려보십시오.
네 개 중 이것이 가장 잘 버텼습니다. 그리고 왜 버텼는지에 대한 실험이 6개월 사이에 나왔습니다.
단계가 소유감을 가릅니다#
DIS 2026(Designing Interactive Systems)에 실린 「From Planning to Revision: How AI Writing Support at Different Stages Alters Ownership」은 참가자 253명 을 대상으로 한 피험자 간 설계 실험입니다. 300단어 논증 에세이를 개요 → 초안 → 개정 세 단계로 쓰게 하고, AI 보조를 어느 단계에 넣는지를 조작했습니다.
| AI 보조 단계 | 소유감 변화 |
|---|---|
| 계획(planning) | 감소하지만 미미 |
| 초안(drafting) | 감소 최대 |
| 개정(revision) | 중간 |
그리고 그 차이는 AI 가 기여한 텍스트와 아이디어의 양 에 대응했습니다. 흥미로운 세부가 하나 더 있습니다.
개요 단계에서 AI 아이디어를 요청한 참가자들은 그 아이디어가 자기 생각과 겹친다고 느껴 자주 버렸습니다. 반면 개정 단계의 AI 제안은 훨씬 자주 채택되었습니다.
원문은 “내 생각의 뼈대가 있는 상태에서 AI 의 도움을 받으면 AI 의 답변에 휘둘리지 않는다"고 썼습니다. 이 실험은 그 문장에 메커니즘을 붙여 줍니다. 뼈대가 먼저 있으면 AI 아이디어는 검토 대상이 되고, 뼈대가 없으면 AI 아이디어가 뼈대가 됩니다.
초안은 누가 썼든 최종물을 붙잡습니다#
같은 연구의 또 다른 발견입니다. 초안은 그것이 사람이 쓴 것이든 AI 가 쓴 것이든 최종 결과물을 앵커링했습니다. AI 보조가 바꾼 것은 그 이월이 축자적인가(exact strings) 재서술인가 였을 뿐, 내용이 흘러 들어가는지 여부 자체는 바뀌지 않았습니다.
이것은 “AI 초안을 받아서 내가 많이 고치면 된다"는 흔한 반론에 대한 답입니다. 고쳐도 틀은 남습니다. 표현만 내 것이 됩니다.
다만 원문이 몰랐던 대가#
정직하게 덧붙일 것이 있습니다. 같은 실험에서 AI 기여가 많을수록 에세이 품질은 올라갔습니다.
즉 소유감과 품질은 상충합니다. “초안은 내가 쓴다"는 규칙은 공짜가 아니라 품질을 지불하고 소유감과 이해를 사는 거래 입니다. 원문은 이 거래를 몰랐고, 그래서 무조건적인 규칙처럼 썼습니다.
그러면 언제 지불할 가치가 있는가. 판단 기준은 이렇게 잡는 것이 합리적입니다.
- 나중에 이 결과물을 내가 설명하거나 고쳐야 하는가 → 지불합니다.
- 이 영역에서 내 숙련이 계속 필요한가 → 지불합니다.
- 한 번 쓰고 버리는 산출물이고, 품질이 곧 목적인가 → 지불하지 않아도 됩니다.
개정된 규칙#
원문의 “최소 5분"은 임의의 숫자였습니다. 근거가 있는 형태로 바꾸면 이렇습니다.
계획 단계는 내가, 개정 단계는 AI 와. 초안 단계에 AI 를 넣는 것이 소유감을 가장 크게 깎습니다.
시간이 아니라 단계 가 기준입니다.
판정: 유지. “5분"을 “단계"로 교체합니다.
Action 2. 30% 수정 룰 — 폐기합니다#
원문의 조언은 이랬습니다.
AI가 생성한 결과물을 그대로 복사+붙여넣기 하는 것을 금기시하십시오. 반드시 전체 내용의 20~30%는 나의 문체, 나의 경험, 나의 인사이트로 수정하거나 재작성해야 합니다. (…) 수정하는 과정에서 비판적 사고가 작동하며, 결과물에 대한 나의 ‘소유권’과 ‘책임’이 생겨납니다.
이 조언을 폐기합니다. 세 가지 이유입니다.
이유 1. 20~30% 라는 숫자에 근거가 없습니다#
저는 이 임계값을 뒷받침하는 연구를 찾지 못했습니다. 측정하기 쉬운 숫자였을 뿐입니다. 그리고 측정하기 쉬운 숫자를 목표로 삼으면 그 숫자만 채워집니다.
이유 2. “고치는 과정에서 비판적 사고가 작동한다"는 가정이 흔들립니다#
Action 1 에서 인용한 DIS 2026 실험의 결과를 다시 보겠습니다. 개정 단계의 AI 제안은 다른 어느 단계보다 자주 채택되었습니다. 즉 개정은 비판이 가장 활발한 국면이 아니라, 수용이 가장 활발한 국면 입니다.
그리고 같은 실험에서 초안은 사람이 썼든 AI 가 썼든 최종물을 앵커링했습니다. 30%를 고쳐도 구조는 남습니다. 고친 30%는 대체로 문체 입니다.
이유 3. 문체를 고쳐도 틀린 숫자는 그대로 있습니다#
이것이 결정적입니다. 30% 수정 룰은 검증과 무관한 지표 입니다.
Part 1 에서 본 Charlotin DB 의 오류 유형 분포를 다시 보겠습니다. 항목 5,748개 중 날조 3,238, 왜곡된 인용 1,538, 허위 인용문 937 입니다. 이 오류들은 문체를 아무리 고쳐도 남습니다. 오히려 내 문체로 다듬어진 만큼 더 그럴듯해집니다.
workslop 이 정확히 이렇게 생산됩니다. 그럴듯해 보이고, 발신자의 문체가 묻어 있고, 받는 사람이 두 시간을 씁니다.
‘인턴 사원’ 비유도 정확하지 않습니다#
원문은 AI 를 “빠르고 똑똑하지만 실수가 잦은 신입 인턴"으로 정의하라고 했습니다. 비유로는 친근하지만, 2026년 기준으로 세 군데가 어긋납니다.
- 인턴은 자기 한계를 압니다. 모르는 것 앞에서는 목소리가 작아집니다. 모델은 정확도가 47.8%인 구간에서도 95.2% 구간과 같은 어조로 말합니다(Part 1 의 확신-성과 격차 34.6%p).
- 인턴은 성장합니다. 이번 주에 지적한 것을 다음 주에 반영합니다. 모델은 컨텍스트를 벗어나면 그 지적을 잃습니다. (메모리 기능이 이 그림을 부분적으로 바꾸는데, 그 얘기는 Action 3 에서 하겠습니다.)
- 인턴에게는 책임을 물을 수 있습니다. 법원이 인정한 AI 환각 사건 1,934건에서 제재를 받은 것은 전부 사람입니다.
가장 위험한 것은 첫 번째입니다. 인턴 비유는 “실수가 잦다"는 것까지만 알려 주고, “실수가 잦은 지점을 스스로 알리지 않는다"는 것은 알려 주지 않습니다.
대체 규칙: 수정량이 아니라 질문 순서#
폐기했으면 대체안을 내야 합니다. 이 글 앞부분에서 본 단일 변수 — 무엇을 물었는가 — 를 실행 규칙으로 바꾸면 이렇게 됩니다.
규칙 A. 답을 요구하기 전에 한 단계를 끼웁니다.
낯선 영역일수록 첫 프롬프트를 “해 줘"가 아니라 다음 중 하나로 시작합니다.
- “이 문제에서 핵심 개념이 뭔지 먼저 설명해 줘”
- “접근 방법을 세 가지로 나눠 주고 각각의 트레이드오프를 알려 줘”
- “내 접근이 이런데, 어디가 취약한지 짚어 줘”
Shen & Tamkin 의 실험에서 개념을 물어본 사람과 생성을 위임한 사람의 이해도 격차가 65% 대 40% 미만 이었습니다. 프롬프트 한 줄의 차이입니다.
규칙 B. 수정량 대신 검증 지점을 셉니다.
밖으로 나가는 산출물에서 확인할 것을 네 종류로 고정합니다. 숫자, 고유명사, 인용, 링크. 이 넷은 틀렸을 때 되돌리기 어렵고, 확인 비용이 낮고, 확인 여부를 스스로 속이기 어렵습니다.
“30% 고쳤다"는 자기 보고에 가깝습니다. “인용 네 개를 원문에서 확인했다"는 사실 진술입니다.
판정: 폐기. 수정량 기준을 질문 형식 기준과 검증 지점 기준으로 대체합니다.
Action 3. 고유성 주입 — 전제가 낡았습니다#
원문은 이렇게 썼습니다.
AI가 흉내 낼 수 없는 것은 ‘나의 구체적 경험’입니다. AI는 2024년의 보편적 지식을 알지만, 어제 내가 겪은 일은 모릅니다.
굵게 표시한 문장이 2026년 8월 현재 더 이상 참이 아닙니다.
AI 는 어제 내가 겪은 일을 알고 있을 수 있습니다#
OpenAI 가 공개한 자체 평가 수치입니다. 벤더 자체 평가 라는 점을 감안하고 보셔야 합니다.
| 평가 항목 | 2024 | 2025 | 2026 |
|---|---|---|---|
| 사실 회상 | 41.5% | 67.9% | 82.8% |
| 선호 준수 | 31.4% | 55.3% | 71.3% |
| 시간 민감 과제 성공률 | 9.4% | 52.2% | 75.1% |
세 번째 줄이 원문의 전제를 직접 겨냥합니다. “어제"에 해당하는 시간 민감 정보를 반영하는 능력이 2년 사이 9.4%에서 75.1%로 올라갔습니다.
그리고 이 축적은 사용자가 의도적으로 넣은 것만이 아닙니다. CHI 2026 에 발표된 「Relational Gains, Privacy Strains」는 실사용자 80명의 메모리 항목 2,050개 를 분석했습니다.
- 96% 가 시스템이 일방적으로 생성 한 것이었습니다.
- 28% 에 GDPR 이 정의하는 개인정보가 들어 있었습니다.
- 52% 에 사용자에 대한 심리적 추론이 들어 있었습니다.
- 설문 응답자의 약 절반은 메모리 기능이 있다는 사실을 모르거나 확신하지 못했습니다.
원문은 “나의 맥락을 상세히 부여하십시오"라고 조언했습니다. 2026년에는 조언할 필요가 없습니다. 이미 부여되고 있고, 절반은 그 사실을 모릅니다.
그래서 남는 차별점이 바뀝니다#
“내 맥락"이 더 이상 나만 가진 것이 아니라면, 고유성의 원천은 다른 데 있어야 합니다. 2026년 자료가 가리키는 곳은 세 군데입니다.
첫째, 통제. 무엇이 저장되고 무엇이 저장되지 않는지를 결정하는 것. 메모리의 96%가 자동 생성이라면, 이 결정은 기본값에 맡기면 내려지지 않습니다.
둘째, 판단과 책임. 모델이 맥락을 갖게 되어도 그 맥락으로 무엇을 할지 정하고 결과를 책임지는 자리는 비어 있습니다. Part 1 에서 본 1,934건의 제재 대상은 전부 사람이었습니다.
셋째, 왜곡 방어. 이게 6개월 전에는 없던 항목입니다.
고유성 주입은 이제 ‘첨가’가 아니라 ‘방어’입니다#
Part 1 에서 인용한 Röttger 등의 연구를 다시 꺼내겠습니다. 필자 2,939명, 독자 11,091명 규모의 실험에서 AI 보조를 받은 글은 필자를 더 단정적이고, 더 유능하고, 더 긍정적 으로 보이게 만들었고, 지각되는 인구통계 프로필을 더 특권적인 집단 쪽으로 이동시켰습니다.
원문은 고유성 주입을 “나만의 에피소드와 주관적 감상을 의도적으로 섞는” 첨가 행위로 그렸습니다. 실제로 일어나는 일은 첨가가 아니라 덮어쓰기 입니다. AI 보조는 내 문체 위에 다른 문체를 얹는 게 아니라, 내가 어떤 사람으로 읽히는지를 바꿉니다.
게다가 그 왜곡은 독자에게 더 신뢰받는 방향 으로 일어납니다(후속 실험 참가자 8,798명). 그래서 스스로 알아차리기가 어렵습니다. 반응이 좋아지기 때문입니다.
개정된 규칙#
맥락을 더 넣는 것이 아니라, 무엇이 저장되는지를 정기적으로 확인하십시오. 그리고 분기에 한 번, AI 없이 쓴 자기 글과 AI 와 쓴 글을 나란히 놓고 읽어 보십시오.
두 번째가 특히 값쌉니다. 왜곡은 한 편에서는 보이지 않고 두 편을 겹쳐 놓아야 보입니다.
판정: 수정. 전제(“AI 는 내 맥락을 모른다”)를 철회하고, 처방을 첨가에서 통제·판단·왜곡 점검으로 바꿉니다.
Action 4. 의도적인 불편 — 유지하되, 금식보다 가드레일#
원문의 조언은 이랬습니다.
일주일에 한 번, 혹은 특정 프로젝트는 AI 도구 없이(심지어 검색도 최소화하고) 오로지 자신의 지식과 책, 사색만으로 해결해 봅니다.
이론적 뿌리는 튼튼합니다. Robert Bjork 와 Elizabeth Bjork 의 바람직한 어려움(desirable difficulties) 개념입니다. 간격 두기, 섞어서 연습하기, 다시 읽는 대신 스스로 인출해 보기 — 수행을 느리게 만들지만 장기 기억과 전이를 강화하는 조건들입니다. 1990년대에 정립된 오래된 개념 이라는 점을 밝혀 둡니다.
문제는 처방의 실행 가능성입니다.
“주 1회 금식"은 개인에게도 조직에게도 잘 작동하지 않습니다#
Gallup 의 2026년 2분기 조사(미국 취업자 22,573명)에서 52% 가 업무에 AI 를 쓰고, 30% 가 주 수회 이상, 15% 가 매일 씁니다. Huemmer 등의 종단 연구에서는 학계 참가자의 일상 사용률이 6개월 만에 52.4%에서 95.7% 로 올랐습니다.
이 환경에서 “일주일에 하루는 안 쓴다"는 규칙은 유지되기 어렵습니다. 그리고 조직 안에서는 대체로 선택지가 아닙니다.
데이터가 지지하는 것은 금식이 아니라 형태 변경입니다#
앞서 본 Bastani 등의 PNAS 연구가 이 자리에 정확히 들어맞습니다. 세 조건 중 좋았던 것은 “AI 를 끊은 조건"이 아니라 “AI 의 형태를 바꾼 조건” 이었습니다.
| 조건 | 연습 중 성과 | AI 제거 후 시험 |
|---|---|---|
| 통제군 (AI 없음) | 기준 | 기준 |
| 무제한 GPT | +48% | −17% |
| 튜터형 GPT (직접 답 없음) | +127% | 손해 거의 소멸 |
튜터형 조건은 연습 중 성과도 가장 좋았고 사후 손해도 없었습니다. 금식은 두 마리를 다 놓치고, 가드레일은 두 마리를 다 잡았습니다.
다만 “AI 없이 해 보기"는 다른 용도로 살아남습니다#
훈련 방법으로는 약하지만, 진단 방법으로는 강력합니다.
Liu 등의 실험에서 측정된 것이 바로 이것입니다. AI 를 치웠을 때의 성능. 그 격차가 지금 내가 얼마나 의존하고 있는지를 알려 주는 유일한 지표입니다. Part 1 에서 본 Rismanchian 등의 연구가 감독 시험 성적을 대조군으로 쓴 것도 같은 이치입니다.
그래서 원문의 조언은 이렇게 바꿔 쓰는 것이 정확합니다.
상시로는 가드레일을 걸고, 분기에 한 번은 진단하십시오.
- 가드레일(상시): 답을 요구하기 전에 개념·접근·검토를 요구하는 단계를 끼웁니다. Action 2 의 규칙 A 와 같은 것입니다.
- 진단(분기 1회): 평소 AI 로 하던 작업 하나를 AI 없이 해 봅니다. 목적은 훈련이 아니라 격차 측정 입니다. 격차가 커졌다면 가드레일을 조정할 때입니다.
판정: 유지. “주 1회 금식"을 “상시 가드레일 + 분기 진단"으로 바꿉니다.
정리#
- 2026년 데이터가 반복해서 가리키는 변수는 사용량이 아니라 질문의 형식입니다. 서로 다른 세 연구가 같은 지점에서 갈렸습니다. 답을 요구한 쪽은 도구를 치웠을 때 통제군보다 낮았고, 과정을 요구한 쪽은 통제군 수준을 유지했습니다.
- “초안은 내가 쓴다"는 살아남았고, 기준이 시간에서 단계로 바뀝니다. 계획 단계 AI 보조는 소유감을 거의 깎지 않고, 초안 단계 보조가 가장 크게 깎습니다. 다만 AI 기여가 많을수록 품질은 올라가므로, 이 규칙은 품질을 지불하고 이해를 사는 거래 입니다.
- “30% 수정 룰"은 폐기합니다. 임계값에 근거가 없고, 개정 단계는 비판이 아니라 수용이 활발한 국면이며, 무엇보다 문체를 고쳐도 틀린 숫자는 그대로 남습니다.
- 대체 규칙은 두 개입니다. 답을 요구하기 전에 개념·접근·검토를 한 단계 끼울 것. 그리고 수정량 대신 숫자·고유명사·인용·링크 네 가지 검증 지점을 셀 것.
- “AI 는 내 맥락을 모른다"는 전제는 철회합니다. 시간 민감 과제 성공률이 2년 사이 9.4%에서 75.1%로 올랐고, 메모리의 96%는 시스템이 알아서 만들며, 사용자 절반은 그 사실을 모릅니다.
- 고유성은 첨가가 아니라 방어의 문제가 되었습니다. AI 보조는 필자를 더 단정적·유능·긍정적으로 보이게 하고 지각되는 계층을 이동시키며, 독자는 그런 글을 더 신뢰합니다. 반응이 좋아지기 때문에 스스로 알아차리기 어렵습니다.
- “주 1회 AI 금식"보다 “상시 가드레일"이 낫습니다. PNAS 연구에서 튜터형 조건은 연습 성과가 가장 높으면서 사후 손해도 없었습니다. AI 없이 해 보기는 훈련이 아니라 진단 으로 남겨 두십시오.
Part 3 에서는 원문이 아예 예상하지 못한 것들을 다룹니다. 에이전트가 판단이 아니라 실행까지 가져간 뒤에 ‘사고의 외주화’라는 말이 무엇을 가리키게 되었는지, 그리고 원문의 결론이었던 Co-pilot / Autopilot 이분법이 왜 더 이상 성립하지 않는지입니다.
References#
2026년 자료
- Liu, G., Christian, B., Dumbalska, T., Bakker, M. A., & Dubey, R. (2026, April 6). AI Assistance Reduces Persistence and Hurts Independent Performance. arXiv:2604.04721. https://arxiv.org/abs/2604.04721 — 프리프린트. 무작위 대조 실험 3건, 참가자 1,222명.
- Shen, J. H., & Tamkin, A. (2026, February). How AI assistance impacts the formation of coding skills. Anthropic. https://www.anthropic.com/research/AI-assistance-coding-skills — arXiv:2601.20245. 벤더 자체 연구. 참가자 52명, 무작위 배정.
- From Planning to Revision: How AI Writing Support at Different Stages Alters Ownership. Proceedings of DIS 2026. https://doi.org/10.1145/3800645.3813003 — 동료 심사 학회 논문. 피험자 간 설계, 참가자 253명. 온라인 게재 2026-06-13.
- Relational Gains, Privacy Strains: Exploring Users’ Perceptions and Experiences with ChatGPT’s Memory Feature. Proceedings of CHI 2026. https://dl.acm.org/doi/10.1145/3772318.3791635 — 실사용자 80명의 메모리 항목 2,050개 분석.
- Röttger, P., Hackenburg, K., Kirk, H. R., & Summerfield, C. (2026, April 24). Measuring and Mitigating Persona Distortions from AI Writing Assistance. arXiv:2604.22503. https://arxiv.org/abs/2604.22503 — 프리프린트. 필자 2,939명, 독자 11,091명.
- Gallup. (2026). Organizational AI Adoption Jumps Six Points. https://www.gallup.com/workplace/712736/organizational-adoption-jumps-six-points.aspx — 조사 2026-05-06~05-20, 미국 취업자 22,573명.
- Huemmer, M., Durner, F., Shyiramunda, T., & Cummings-Koether, M. J. (2026, January 21). AI, Metacognition, and the Verification Bottleneck. arXiv:2601.17055. https://arxiv.org/abs/2601.17055 — 프리프린트. 종단 자가보고.
- OpenAI 의 메모리 성능 수치는 벤더 자체 평가 입니다. 독립 검증된 수치가 아닙니다.
비교·배경 자료 (발표 연도를 함께 적습니다)
- Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS. https://www.pnas.org/doi/10.1073/pnas.2422633122 — 2025년 자료. 동료 심사, 튀르키예 고교생 약 1,000명 대상 현장 실험.
- Bjork, R. A., & Bjork, E. L. 의 desirable difficulties 개념은 1990년대에 정립된 오래된 이론 입니다.
- Niederhoffer, K., Kellerman, G. R., Lee, A., et al. (2025, September 22). AI-Generated “Workslop” Is Destroying Productivity. Harvard Business Review. https://hbr.org/2025/09/ai-generated-workslop-is-destroying-productivity — 2025년 자료.
- Charlotin, D. AI Hallucination Cases Database. https://www.damiencharlotin.com/hallucinations/ — 2026-08-20 접속, 누적 1,934건. 법원이 명시적으로 인정한 건만 집계하는 하한선입니다.