이 글은 Claude Opus 5 를 이용해 초안이 작성되었으며, 이후 퇴고를 거쳤습니다.


Part 1에서는 원문의 진단 네 가지를 2026년 자료로 채점했습니다. 두 개는 유지, 두 개는 수정이었습니다. 이번 편은 처방 — 원문이 제시한 네 가지 액션 플랜입니다.

진단보다 처방을 채점하기가 훨씬 어렵습니다. 진단은 “그런 일이 일어나는가"만 물으면 되지만, 처방은 “그렇게 하면 나아지는가"를 물어야 하고, 그런 실험은 훨씬 적기 때문입니다. 그래도 6개월 사이 몇 개가 나왔습니다. 그리고 그 몇 개가 원문의 네 가지 중 두 개를 살리고 두 개를 무너뜨립니다.

원문의 액션판정
1. 빈 화면의 법칙 — 초안은 내가 쓴다유지. 네 개 중 가장 잘 버텼습니다
2. 인턴 사원 마인드셋 — 30% 수정 룰폐기. 근거가 없고, 반대 방향 증거가 있습니다
3. 고유성 주입 — “AI 는 어제 내 일을 모른다”수정. 전제가 낡았습니다
4. 의도적인 불편 즐기기유지, 처방 변경. 금식보다 가드레일입니다

먼저: 2026년 데이터가 가리키는 단일 변수#

네 개를 하나씩 보기 전에, 6개월 사이 나온 연구들이 약속이라도 한 듯 같은 지점을 가리켰다 는 사실을 먼저 적어야겠습니다.

세 연구입니다. 대상도, 과제도, 국가도, 연구 그룹도 다릅니다.

연구대상갈라진 지점결과
Liu et al. 2026 (RCT, n=1,222)미국 성인, 분수·독해직접 답 요구 vs 힌트 요구직접 답 요구 쪽만 성능 급락, 포기 약 2배
Shen & Tamkin 2026 (Anthropic, n=52)주니어 엔지니어, 낯선 라이브러리코드 생성 위임 vs 개념 질문40% 미만 vs 65% 이상 (개념 퀴즈)
Bastani et al. 2025 (PNAS, 약 1,000명)튀르키예 고교생, 수학무제한 GPT vs 튜터형 GPT시험에서 −17% vs 효과 거의 소멸

Bastani 등의 연구는 특히 선명합니다. 연습 문제를 푸는 동안에는 무제한 GPT 그룹이 통제군보다 48% 잘했고, 튜터형(직접 답을 주지 않고 유도하는) 그룹은 127% 잘했습니다. 그런데 AI 를 치우고 시험을 보자 무제한 그룹은 통제군보다 17% 못했고, 튜터형 그룹에서는 그 손해가 거의 사라졌습니다. PNAS 에 실린 동료 심사 논문이고, 제목이 「Generative AI without guardrails can harm learning」입니다. 가드레일이 제목에 들어간 이유가 이겁니다.

flowchart TB
    Q["같은 모델, 같은 시간,<br/>같은 과제"] --> A["답을 요구한다<br/>'이거 해 줘'"]
    Q --> B["과정을 요구한다<br/>'어떻게 접근하지'<br/>'이 개념이 뭐지'"]
    A --> A1["즉시 성과 ↑↑"]
    B --> B1["즉시 성과 ↑"]
    A1 --> A2["도구를 치우면<br/>통제군보다 낮음"]
    B1 --> B2["도구를 치워도<br/>통제군 수준 유지"]
    style A fill:#FF9999,color:#000000
    style B fill:#90EE90,color:#000000
    style A2 fill:#FF9999,color:#000000
    style B2 fill:#90EE90,color:#000000
    style Q fill:#87CEEB,color:#000000

원문의 액션 플랜은 얼마나 개입할 것인가 를 다뤘습니다. 5분 먼저 생각하기, 30% 고치기, 주 1회 끊기 — 전부 양의 문제입니다. 2026년 데이터가 가리키는 것은 양이 아니라 형식 입니다. 무엇을 물었는가.

이 기준으로 네 개를 다시 봅니다.


Action 1. 빈 화면의 법칙 — 유지, 그리고 더 정확해졌습니다#

원문의 조언은 이랬습니다.

AI에게 질문하기 전에, 최소 5분은 스스로 목차를 잡거나 핵심 키워드를 나열해 봅니다. 개발자라면 의사코드(Pseudo-code)나 아키텍처 다이어그램을 먼저 그려보십시오.

네 개 중 이것이 가장 잘 버텼습니다. 그리고 왜 버텼는지에 대한 실험이 6개월 사이에 나왔습니다.

단계가 소유감을 가릅니다#

DIS 2026(Designing Interactive Systems)에 실린 「From Planning to Revision: How AI Writing Support at Different Stages Alters Ownership」은 참가자 253명 을 대상으로 한 피험자 간 설계 실험입니다. 300단어 논증 에세이를 개요 → 초안 → 개정 세 단계로 쓰게 하고, AI 보조를 어느 단계에 넣는지를 조작했습니다.

AI 보조 단계소유감 변화
계획(planning)감소하지만 미미
초안(drafting)감소 최대
개정(revision)중간

그리고 그 차이는 AI 가 기여한 텍스트와 아이디어의 양 에 대응했습니다. 흥미로운 세부가 하나 더 있습니다.

개요 단계에서 AI 아이디어를 요청한 참가자들은 그 아이디어가 자기 생각과 겹친다고 느껴 자주 버렸습니다. 반면 개정 단계의 AI 제안은 훨씬 자주 채택되었습니다.

원문은 “내 생각의 뼈대가 있는 상태에서 AI 의 도움을 받으면 AI 의 답변에 휘둘리지 않는다"고 썼습니다. 이 실험은 그 문장에 메커니즘을 붙여 줍니다. 뼈대가 먼저 있으면 AI 아이디어는 검토 대상이 되고, 뼈대가 없으면 AI 아이디어가 뼈대가 됩니다.

초안은 누가 썼든 최종물을 붙잡습니다#

같은 연구의 또 다른 발견입니다. 초안은 그것이 사람이 쓴 것이든 AI 가 쓴 것이든 최종 결과물을 앵커링했습니다. AI 보조가 바꾼 것은 그 이월이 축자적인가(exact strings) 재서술인가 였을 뿐, 내용이 흘러 들어가는지 여부 자체는 바뀌지 않았습니다.

이것은 “AI 초안을 받아서 내가 많이 고치면 된다"는 흔한 반론에 대한 답입니다. 고쳐도 틀은 남습니다. 표현만 내 것이 됩니다.

다만 원문이 몰랐던 대가#

정직하게 덧붙일 것이 있습니다. 같은 실험에서 AI 기여가 많을수록 에세이 품질은 올라갔습니다.

즉 소유감과 품질은 상충합니다. “초안은 내가 쓴다"는 규칙은 공짜가 아니라 품질을 지불하고 소유감과 이해를 사는 거래 입니다. 원문은 이 거래를 몰랐고, 그래서 무조건적인 규칙처럼 썼습니다.

그러면 언제 지불할 가치가 있는가. 판단 기준은 이렇게 잡는 것이 합리적입니다.

  • 나중에 이 결과물을 내가 설명하거나 고쳐야 하는가 → 지불합니다.
  • 이 영역에서 내 숙련이 계속 필요한가 → 지불합니다.
  • 한 번 쓰고 버리는 산출물이고, 품질이 곧 목적인가 → 지불하지 않아도 됩니다.

개정된 규칙#

원문의 “최소 5분"은 임의의 숫자였습니다. 근거가 있는 형태로 바꾸면 이렇습니다.

계획 단계는 내가, 개정 단계는 AI 와. 초안 단계에 AI 를 넣는 것이 소유감을 가장 크게 깎습니다.

시간이 아니라 단계 가 기준입니다.

판정: 유지. “5분"을 “단계"로 교체합니다.


Action 2. 30% 수정 룰 — 폐기합니다#

원문의 조언은 이랬습니다.

AI가 생성한 결과물을 그대로 복사+붙여넣기 하는 것을 금기시하십시오. 반드시 전체 내용의 20~30%는 나의 문체, 나의 경험, 나의 인사이트로 수정하거나 재작성해야 합니다. (…) 수정하는 과정에서 비판적 사고가 작동하며, 결과물에 대한 나의 ‘소유권’과 ‘책임’이 생겨납니다.

이 조언을 폐기합니다. 세 가지 이유입니다.

이유 1. 20~30% 라는 숫자에 근거가 없습니다#

저는 이 임계값을 뒷받침하는 연구를 찾지 못했습니다. 측정하기 쉬운 숫자였을 뿐입니다. 그리고 측정하기 쉬운 숫자를 목표로 삼으면 그 숫자만 채워집니다.

이유 2. “고치는 과정에서 비판적 사고가 작동한다"는 가정이 흔들립니다#

Action 1 에서 인용한 DIS 2026 실험의 결과를 다시 보겠습니다. 개정 단계의 AI 제안은 다른 어느 단계보다 자주 채택되었습니다. 즉 개정은 비판이 가장 활발한 국면이 아니라, 수용이 가장 활발한 국면 입니다.

그리고 같은 실험에서 초안은 사람이 썼든 AI 가 썼든 최종물을 앵커링했습니다. 30%를 고쳐도 구조는 남습니다. 고친 30%는 대체로 문체 입니다.

이유 3. 문체를 고쳐도 틀린 숫자는 그대로 있습니다#

이것이 결정적입니다. 30% 수정 룰은 검증과 무관한 지표 입니다.

Part 1 에서 본 Charlotin DB 의 오류 유형 분포를 다시 보겠습니다. 항목 5,748개 중 날조 3,238, 왜곡된 인용 1,538, 허위 인용문 937 입니다. 이 오류들은 문체를 아무리 고쳐도 남습니다. 오히려 내 문체로 다듬어진 만큼 더 그럴듯해집니다.

workslop 이 정확히 이렇게 생산됩니다. 그럴듯해 보이고, 발신자의 문체가 묻어 있고, 받는 사람이 두 시간을 씁니다.

‘인턴 사원’ 비유도 정확하지 않습니다#

원문은 AI 를 “빠르고 똑똑하지만 실수가 잦은 신입 인턴"으로 정의하라고 했습니다. 비유로는 친근하지만, 2026년 기준으로 세 군데가 어긋납니다.

  • 인턴은 자기 한계를 압니다. 모르는 것 앞에서는 목소리가 작아집니다. 모델은 정확도가 47.8%인 구간에서도 95.2% 구간과 같은 어조로 말합니다(Part 1 의 확신-성과 격차 34.6%p).
  • 인턴은 성장합니다. 이번 주에 지적한 것을 다음 주에 반영합니다. 모델은 컨텍스트를 벗어나면 그 지적을 잃습니다. (메모리 기능이 이 그림을 부분적으로 바꾸는데, 그 얘기는 Action 3 에서 하겠습니다.)
  • 인턴에게는 책임을 물을 수 있습니다. 법원이 인정한 AI 환각 사건 1,934건에서 제재를 받은 것은 전부 사람입니다.

가장 위험한 것은 첫 번째입니다. 인턴 비유는 “실수가 잦다"는 것까지만 알려 주고, “실수가 잦은 지점을 스스로 알리지 않는다"는 것은 알려 주지 않습니다.

대체 규칙: 수정량이 아니라 질문 순서#

폐기했으면 대체안을 내야 합니다. 이 글 앞부분에서 본 단일 변수 — 무엇을 물었는가 — 를 실행 규칙으로 바꾸면 이렇게 됩니다.

규칙 A. 답을 요구하기 전에 한 단계를 끼웁니다.

낯선 영역일수록 첫 프롬프트를 “해 줘"가 아니라 다음 중 하나로 시작합니다.

  1. “이 문제에서 핵심 개념이 뭔지 먼저 설명해 줘”
  2. “접근 방법을 세 가지로 나눠 주고 각각의 트레이드오프를 알려 줘”
  3. “내 접근이 이런데, 어디가 취약한지 짚어 줘”

Shen & Tamkin 의 실험에서 개념을 물어본 사람과 생성을 위임한 사람의 이해도 격차가 65% 대 40% 미만 이었습니다. 프롬프트 한 줄의 차이입니다.

규칙 B. 수정량 대신 검증 지점을 셉니다.

밖으로 나가는 산출물에서 확인할 것을 네 종류로 고정합니다. 숫자, 고유명사, 인용, 링크. 이 넷은 틀렸을 때 되돌리기 어렵고, 확인 비용이 낮고, 확인 여부를 스스로 속이기 어렵습니다.

“30% 고쳤다"는 자기 보고에 가깝습니다. “인용 네 개를 원문에서 확인했다"는 사실 진술입니다.

판정: 폐기. 수정량 기준을 질문 형식 기준과 검증 지점 기준으로 대체합니다.


Action 3. 고유성 주입 — 전제가 낡았습니다#

원문은 이렇게 썼습니다.

AI가 흉내 낼 수 없는 것은 ‘나의 구체적 경험’입니다. AI는 2024년의 보편적 지식을 알지만, 어제 내가 겪은 일은 모릅니다.

굵게 표시한 문장이 2026년 8월 현재 더 이상 참이 아닙니다.

AI 는 어제 내가 겪은 일을 알고 있을 수 있습니다#

OpenAI 가 공개한 자체 평가 수치입니다. 벤더 자체 평가 라는 점을 감안하고 보셔야 합니다.

평가 항목202420252026
사실 회상41.5%67.9%82.8%
선호 준수31.4%55.3%71.3%
시간 민감 과제 성공률9.4%52.2%75.1%

세 번째 줄이 원문의 전제를 직접 겨냥합니다. “어제"에 해당하는 시간 민감 정보를 반영하는 능력이 2년 사이 9.4%에서 75.1%로 올라갔습니다.

그리고 이 축적은 사용자가 의도적으로 넣은 것만이 아닙니다. CHI 2026 에 발표된 「Relational Gains, Privacy Strains」는 실사용자 80명의 메모리 항목 2,050개 를 분석했습니다.

  • 96% 가 시스템이 일방적으로 생성 한 것이었습니다.
  • 28% 에 GDPR 이 정의하는 개인정보가 들어 있었습니다.
  • 52% 에 사용자에 대한 심리적 추론이 들어 있었습니다.
  • 설문 응답자의 약 절반은 메모리 기능이 있다는 사실을 모르거나 확신하지 못했습니다.

원문은 “나의 맥락을 상세히 부여하십시오"라고 조언했습니다. 2026년에는 조언할 필요가 없습니다. 이미 부여되고 있고, 절반은 그 사실을 모릅니다.

그래서 남는 차별점이 바뀝니다#

“내 맥락"이 더 이상 나만 가진 것이 아니라면, 고유성의 원천은 다른 데 있어야 합니다. 2026년 자료가 가리키는 곳은 세 군데입니다.

첫째, 통제. 무엇이 저장되고 무엇이 저장되지 않는지를 결정하는 것. 메모리의 96%가 자동 생성이라면, 이 결정은 기본값에 맡기면 내려지지 않습니다.

둘째, 판단과 책임. 모델이 맥락을 갖게 되어도 그 맥락으로 무엇을 할지 정하고 결과를 책임지는 자리는 비어 있습니다. Part 1 에서 본 1,934건의 제재 대상은 전부 사람이었습니다.

셋째, 왜곡 방어. 이게 6개월 전에는 없던 항목입니다.

고유성 주입은 이제 ‘첨가’가 아니라 ‘방어’입니다#

Part 1 에서 인용한 Röttger 등의 연구를 다시 꺼내겠습니다. 필자 2,939명, 독자 11,091명 규모의 실험에서 AI 보조를 받은 글은 필자를 더 단정적이고, 더 유능하고, 더 긍정적 으로 보이게 만들었고, 지각되는 인구통계 프로필을 더 특권적인 집단 쪽으로 이동시켰습니다.

원문은 고유성 주입을 “나만의 에피소드와 주관적 감상을 의도적으로 섞는” 첨가 행위로 그렸습니다. 실제로 일어나는 일은 첨가가 아니라 덮어쓰기 입니다. AI 보조는 내 문체 위에 다른 문체를 얹는 게 아니라, 내가 어떤 사람으로 읽히는지를 바꿉니다.

게다가 그 왜곡은 독자에게 더 신뢰받는 방향 으로 일어납니다(후속 실험 참가자 8,798명). 그래서 스스로 알아차리기가 어렵습니다. 반응이 좋아지기 때문입니다.

개정된 규칙#

맥락을 더 넣는 것이 아니라, 무엇이 저장되는지를 정기적으로 확인하십시오. 그리고 분기에 한 번, AI 없이 쓴 자기 글과 AI 와 쓴 글을 나란히 놓고 읽어 보십시오.

두 번째가 특히 값쌉니다. 왜곡은 한 편에서는 보이지 않고 두 편을 겹쳐 놓아야 보입니다.

판정: 수정. 전제(“AI 는 내 맥락을 모른다”)를 철회하고, 처방을 첨가에서 통제·판단·왜곡 점검으로 바꿉니다.


Action 4. 의도적인 불편 — 유지하되, 금식보다 가드레일#

원문의 조언은 이랬습니다.

일주일에 한 번, 혹은 특정 프로젝트는 AI 도구 없이(심지어 검색도 최소화하고) 오로지 자신의 지식과 책, 사색만으로 해결해 봅니다.

이론적 뿌리는 튼튼합니다. Robert Bjork 와 Elizabeth Bjork 의 바람직한 어려움(desirable difficulties) 개념입니다. 간격 두기, 섞어서 연습하기, 다시 읽는 대신 스스로 인출해 보기 — 수행을 느리게 만들지만 장기 기억과 전이를 강화하는 조건들입니다. 1990년대에 정립된 오래된 개념 이라는 점을 밝혀 둡니다.

문제는 처방의 실행 가능성입니다.

“주 1회 금식"은 개인에게도 조직에게도 잘 작동하지 않습니다#

Gallup 의 2026년 2분기 조사(미국 취업자 22,573명)에서 52% 가 업무에 AI 를 쓰고, 30% 가 주 수회 이상, 15% 가 매일 씁니다. Huemmer 등의 종단 연구에서는 학계 참가자의 일상 사용률이 6개월 만에 52.4%에서 95.7% 로 올랐습니다.

이 환경에서 “일주일에 하루는 안 쓴다"는 규칙은 유지되기 어렵습니다. 그리고 조직 안에서는 대체로 선택지가 아닙니다.

데이터가 지지하는 것은 금식이 아니라 형태 변경입니다#

앞서 본 Bastani 등의 PNAS 연구가 이 자리에 정확히 들어맞습니다. 세 조건 중 좋았던 것은 “AI 를 끊은 조건"이 아니라 “AI 의 형태를 바꾼 조건” 이었습니다.

조건연습 중 성과AI 제거 후 시험
통제군 (AI 없음)기준기준
무제한 GPT+48%−17%
튜터형 GPT (직접 답 없음)+127%손해 거의 소멸

튜터형 조건은 연습 중 성과도 가장 좋았고 사후 손해도 없었습니다. 금식은 두 마리를 다 놓치고, 가드레일은 두 마리를 다 잡았습니다.

다만 “AI 없이 해 보기"는 다른 용도로 살아남습니다#

훈련 방법으로는 약하지만, 진단 방법으로는 강력합니다.

Liu 등의 실험에서 측정된 것이 바로 이것입니다. AI 를 치웠을 때의 성능. 그 격차가 지금 내가 얼마나 의존하고 있는지를 알려 주는 유일한 지표입니다. Part 1 에서 본 Rismanchian 등의 연구가 감독 시험 성적을 대조군으로 쓴 것도 같은 이치입니다.

그래서 원문의 조언은 이렇게 바꿔 쓰는 것이 정확합니다.

상시로는 가드레일을 걸고, 분기에 한 번은 진단하십시오.

  • 가드레일(상시): 답을 요구하기 전에 개념·접근·검토를 요구하는 단계를 끼웁니다. Action 2 의 규칙 A 와 같은 것입니다.
  • 진단(분기 1회): 평소 AI 로 하던 작업 하나를 AI 없이 해 봅니다. 목적은 훈련이 아니라 격차 측정 입니다. 격차가 커졌다면 가드레일을 조정할 때입니다.

판정: 유지. “주 1회 금식"을 “상시 가드레일 + 분기 진단"으로 바꿉니다.


정리#

  1. 2026년 데이터가 반복해서 가리키는 변수는 사용량이 아니라 질문의 형식입니다. 서로 다른 세 연구가 같은 지점에서 갈렸습니다. 답을 요구한 쪽은 도구를 치웠을 때 통제군보다 낮았고, 과정을 요구한 쪽은 통제군 수준을 유지했습니다.
  2. “초안은 내가 쓴다"는 살아남았고, 기준이 시간에서 단계로 바뀝니다. 계획 단계 AI 보조는 소유감을 거의 깎지 않고, 초안 단계 보조가 가장 크게 깎습니다. 다만 AI 기여가 많을수록 품질은 올라가므로, 이 규칙은 품질을 지불하고 이해를 사는 거래 입니다.
  3. “30% 수정 룰"은 폐기합니다. 임계값에 근거가 없고, 개정 단계는 비판이 아니라 수용이 활발한 국면이며, 무엇보다 문체를 고쳐도 틀린 숫자는 그대로 남습니다.
  4. 대체 규칙은 두 개입니다. 답을 요구하기 전에 개념·접근·검토를 한 단계 끼울 것. 그리고 수정량 대신 숫자·고유명사·인용·링크 네 가지 검증 지점을 셀 것.
  5. “AI 는 내 맥락을 모른다"는 전제는 철회합니다. 시간 민감 과제 성공률이 2년 사이 9.4%에서 75.1%로 올랐고, 메모리의 96%는 시스템이 알아서 만들며, 사용자 절반은 그 사실을 모릅니다.
  6. 고유성은 첨가가 아니라 방어의 문제가 되었습니다. AI 보조는 필자를 더 단정적·유능·긍정적으로 보이게 하고 지각되는 계층을 이동시키며, 독자는 그런 글을 더 신뢰합니다. 반응이 좋아지기 때문에 스스로 알아차리기 어렵습니다.
  7. “주 1회 AI 금식"보다 “상시 가드레일"이 낫습니다. PNAS 연구에서 튜터형 조건은 연습 성과가 가장 높으면서 사후 손해도 없었습니다. AI 없이 해 보기는 훈련이 아니라 진단 으로 남겨 두십시오.

Part 3 에서는 원문이 아예 예상하지 못한 것들을 다룹니다. 에이전트가 판단이 아니라 실행까지 가져간 뒤에 ‘사고의 외주화’라는 말이 무엇을 가리키게 되었는지, 그리고 원문의 결론이었던 Co-pilot / Autopilot 이분법이 왜 더 이상 성립하지 않는지입니다.


References#

2026년 자료

  • Liu, G., Christian, B., Dumbalska, T., Bakker, M. A., & Dubey, R. (2026, April 6). AI Assistance Reduces Persistence and Hurts Independent Performance. arXiv:2604.04721. https://arxiv.org/abs/2604.04721 — 프리프린트. 무작위 대조 실험 3건, 참가자 1,222명.
  • Shen, J. H., & Tamkin, A. (2026, February). How AI assistance impacts the formation of coding skills. Anthropic. https://www.anthropic.com/research/AI-assistance-coding-skills — arXiv:2601.20245. 벤더 자체 연구. 참가자 52명, 무작위 배정.
  • From Planning to Revision: How AI Writing Support at Different Stages Alters Ownership. Proceedings of DIS 2026. https://doi.org/10.1145/3800645.3813003 — 동료 심사 학회 논문. 피험자 간 설계, 참가자 253명. 온라인 게재 2026-06-13.
  • Relational Gains, Privacy Strains: Exploring Users’ Perceptions and Experiences with ChatGPT’s Memory Feature. Proceedings of CHI 2026. https://dl.acm.org/doi/10.1145/3772318.3791635 — 실사용자 80명의 메모리 항목 2,050개 분석.
  • Röttger, P., Hackenburg, K., Kirk, H. R., & Summerfield, C. (2026, April 24). Measuring and Mitigating Persona Distortions from AI Writing Assistance. arXiv:2604.22503. https://arxiv.org/abs/2604.22503 — 프리프린트. 필자 2,939명, 독자 11,091명.
  • Gallup. (2026). Organizational AI Adoption Jumps Six Points. https://www.gallup.com/workplace/712736/organizational-adoption-jumps-six-points.aspx — 조사 2026-05-06~05-20, 미국 취업자 22,573명.
  • Huemmer, M., Durner, F., Shyiramunda, T., & Cummings-Koether, M. J. (2026, January 21). AI, Metacognition, and the Verification Bottleneck. arXiv:2601.17055. https://arxiv.org/abs/2601.17055 — 프리프린트. 종단 자가보고.
  • OpenAI 의 메모리 성능 수치는 벤더 자체 평가 입니다. 독립 검증된 수치가 아닙니다.

비교·배경 자료 (발표 연도를 함께 적습니다)

  • Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakcı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS. https://www.pnas.org/doi/10.1073/pnas.2422633122 — 2025년 자료. 동료 심사, 튀르키예 고교생 약 1,000명 대상 현장 실험.
  • Bjork, R. A., & Bjork, E. L. 의 desirable difficulties 개념은 1990년대에 정립된 오래된 이론 입니다.
  • Niederhoffer, K., Kellerman, G. R., Lee, A., et al. (2025, September 22). AI-Generated “Workslop” Is Destroying Productivity. Harvard Business Review. https://hbr.org/2025/09/ai-generated-workslop-is-destroying-productivity — 2025년 자료.
  • Charlotin, D. AI Hallucination Cases Database. https://www.damiencharlotin.com/hallucinations/ — 2026-08-20 접속, 누적 1,934건. 법원이 명시적으로 인정한 건만 집계하는 하한선입니다.