죄수의 딜레마 Part 1: 두 죄수의 이야기 — 각자 옳은 선택이 왜 모두를 망치는가
이 글은 Claude Opus 5.5 를 이용해 초안이 작성되었으며, 이후 퇴고를 거쳤습니다.
들어가며#
두뇌 서바이벌을 보다 보면 같은 장면이 되풀이됩니다. 두 참가자가 따로 방에 들어가고, 각자 버튼 하나를 누릅니다. 둘 다 “협력” 을 누르면 상금을 나눠 갖고, 한 사람만 “배신” 을 누르면 배신한 쪽이 전부 가져가며, 둘 다 배신하면 둘 다 빈손입니다. 화면 아래에는 자막이 뜹니다. 죄수의 딜레마.
이 블로그의 「살아남은 자들」 시리즈에서 한국 두뇌 서바이벌 13년을 정리하면서도 이 장면을 여러 번 만났습니다. 그런데 자막에 “죄수의 딜레마” 라고 적힌 게임이 실제로 죄수의 딜레마인 경우는 생각보다 드뭅니다. 이름만 빌려 온 것도 있고, 구조가 조금 달라 정반대의 전략이 정답인 것도 있습니다.
이 시리즈는 그 차이를 가르는 데서 출발합니다. 여섯 편으로 나눠 씁니다.
| 편 | 주제 |
|---|---|
| Part 1 (이 글) | 죄수의 딜레마란 무엇인가 — 이야기, 행렬, 균형, 역사 |
| Part 2 | 닮았지만 다른 게임들 — 치킨, 사슴 사냥, 공공재, 그리고 “스플릿 오어 스틸” |
| Part 3 | 다시 만난다면 — 반복 게임, 액설로드 대회, 팃포탯 |
| Part 4 | 게임쇼의 딜레마 — 『골든 볼스』, 『프렌드 오어 포』, 그리고 연구들 |
| Part 5 | 한국·일본 서바이벌의 딜레마 — 『라이어 게임』에서 『더 커뮤니티』까지 |
| Part 6 | 영화·드라마·애니메이션·게임 속 딜레마 — 『다크 나이트』의 두 배와 그 밖의 장면들 |
앞의 세 편이 이론이고, 뒤의 세 편이 사례입니다. 이론 편에도 수식은 거의 쓰지 않습니다. 부등호 몇 개면 충분합니다.
1. 두 죄수의 이야기#
오늘날 가장 널리 쓰이는 판본은 이렇습니다. 윌리엄 파운드스톤(William Poundstone)이 1992년 책 『죄수의 딜레마(Prisoner’s Dilemma)』에 정리한 형태입니다.
두 공범이 체포되어 각자 독방에 갇혔습니다. 서로 말을 나눌 방법은 없습니다. 경찰은 주된 혐의로 기소할 증거가 부족하다는 것을 압니다. 그래서 둘 다 가벼운 혐의로 1년 씩 살게 할 생각입니다. 동시에 경찰은 각자에게 거래를 제안합니다. 공범에 대해 증언하면 너는 풀려나고, 공범은 3년 을 산다. 단, 둘 다 서로에 대해 증언하면 둘 다 2년 이다. 상대가 무엇을 골랐는지는 내가 돌이킬 수 없게 결정하기 전까지 알 수 없습니다. 상대도 똑같은 제안을 받았다는 것은 압니다.
여기서 “침묵” 은 공범과의 협력, “증언(자백)” 은 공범에 대한 배신 입니다. 이 시리즈에서는 영어 문헌을 따라 이 두 선택을 협력(Cooperate, C)과 배신(Defect, D)으로 부릅니다.
중요한 전제가 하나 있습니다. 두 죄수는 자기 형량만 신경 씁니다. 의리도, 출소 뒤의 보복도, 감옥 밖의 평판도 이 이야기에는 없습니다. 이 전제가 바뀌면 게임이 바뀝니다. 그것이 Part 3 과 Part 4 의 이야기입니다.
2. 보수 행렬#
네 가지 경우를 표로 그리면 이렇습니다. 칸 안의 숫자는 형량이므로 작을수록 좋습니다.
flowchart LR
H0[" "]:::hdr
H1["B 가 침묵<br/>(협력)"]:::hdr
H2["B 가 자백<br/>(배신)"]:::hdr
R1["A 가 침묵<br/>(협력)"]:::hdr
CC["A 1년 · B 1년<br/><br/>둘 다 버틴다"]
CD["A 3년 · B 석방<br/><br/>A 만 당한다"]
R2["A 가 자백<br/>(배신)"]:::hdr
DC["A 석방 · B 3년<br/><br/>B 만 당한다"]
DD["A 2년 · B 2년<br/><br/>둘 다 배신"]
H0 ~~~ H1 ~~~ H2
R1 ~~~ CC ~~~ CD
R2 ~~~ DC ~~~ DD
classDef hdr fill:none,stroke:none,color:#dddddd
style CC fill:#90EE90,color:#000000
style CD fill:#D3D3D3,color:#000000
style DC fill:#D3D3D3,color:#000000
style DD fill:#FF9999,color:#000000
이런 표를 보수 행렬1 이라고 합니다. 초록 칸이 둘에게 함께 좋은 결과이고, 붉은 칸이 이 이야기의 끝입니다. 왜 결말이 붉은 칸인지가 이 글의 나머지입니다.
3. 왜 자백하는가 — 우월 전략#
A 의 자리에서 생각해 봅니다. A 는 B 가 무엇을 골랐는지 모릅니다. 그래서 두 경우를 나눠 봅니다.
- B 가 침묵했다면: 나도 침묵하면 1년, 자백하면 석방입니다. 자백이 낫습니다.
- B 가 자백했다면: 나도 침묵하면 3년, 자백하면 2년입니다. 자백이 낫습니다.
B 가 무엇을 했든 A 에게는 자백이 낫습니다. 상대의 선택과 무관하게 언제나 더 나은 선택을 우월 전략2 이라고 합니다. 이 게임에서는 자백이 A 의 우월 전략입니다. B 의 자리에서도 똑같이 따져 보면 B 의 우월 전략도 자백입니다.
그래서 둘 다 자백하고, 둘 다 2년을 삽니다. 둘 다 침묵했다면 1년이었습니다.
이것이 딜레마 인 이유는 둘 중 누구도 실수하지 않았다는 데 있습니다. 각자 자기 입장에서 가장 나은 선택을 했고, 그 선택이 모여 둘 모두에게 나쁜 결과를 만들었습니다. 개인의 합리성과 집단의 합리성이 정면으로 부딪힙니다.
4. 균형이지만 최선은 아니다#
게임 이론에는 이 결말을 부르는 이름이 둘 있습니다.
내쉬 균형3. 다른 사람이 지금의 선택을 바꾸지 않는다면, 나 혼자 선택을 바꿔서는 이득을 볼 수 없는 상태입니다. (자백, 자백) 에서 A 혼자 침묵으로 바꾸면 2년이 3년이 됩니다. B 도 마찬가지입니다. 그래서 둘 다 자백한 상태는 움직이지 않습니다. 이 게임의 내쉬 균형은 이것 하나뿐 입니다.
파레토 효율4. 누구의 결과도 나빠지지 않으면서 누군가의 결과를 좋게 만들 수 있다면, 지금 상태는 효율적이지 않습니다. (자백, 자백) 에서 (침묵, 침묵) 으로 옮기면 둘 다 2년에서 1년이 됩니다. 아무도 손해 보지 않고 둘 다 좋아집니다. 그러니 이 균형은 파레토 효율적이지 않습니다.
죄수의 딜레마를 한 문장으로 줄이면 이렇습니다.
유일한 균형이 비효율적이다. 모두가 합리적으로 행동하면, 모두에게 더 나은 결과가 있는데도 그곳에 닿지 못한다.
5. 네 글자의 조건 — T > R > P > S#
형량 대신 점수 로 바꾸면 이야기에서 감옥을 떼어 낼 수 있습니다. 클수록 좋은 점수로 바꾸고, 네 칸에 이름을 붙입니다.
| 기호 | 이름 | 언제 받는가 | 액설로드 대회의 점수 |
|---|---|---|---|
| T | 유혹(Temptation) | 나는 배신, 상대는 협력 | 5 |
| R | 보상(Reward) | 둘 다 협력 | 3 |
| P | 처벌(Punishment) | 둘 다 배신 | 1 |
| S | 호구(Sucker) | 나는 협력, 상대는 배신 | 0 |
마지막 열은 Part 3 에서 다룰 로버트 액설로드(Robert Axelrod)의 컴퓨터 대회가 쓴 점수입니다. 이 시리즈에서도 이 점수를 기본으로 씁니다.
flowchart LR
H0[" "]:::hdr
H1["상대 협력"]:::hdr
H2["상대 배신"]:::hdr
R1["나 협력"]:::hdr
CC["R = 3<br/>보상"]
CD["S = 0<br/>호구"]
R2["나 배신"]:::hdr
DC["T = 5<br/>유혹"]
DD["P = 1<br/>처벌"]
H0 ~~~ H1 ~~~ H2
R1 ~~~ CC ~~~ CD
R2 ~~~ DC ~~~ DD
classDef hdr fill:none,stroke:none,color:#dddddd
style CC fill:#90EE90,color:#000000
style CD fill:#D3D3D3,color:#000000
style DC fill:#FFD700,color:#000000
style DD fill:#FF9999,color:#000000
어떤 게임이 죄수의 딜레마가 되려면 네 점수 사이에 이 순서가 성립해야 합니다.
T > R > P > S
세 개의 부등호가 각각 일을 합니다.
- T > R: 상대가 협력할 때 나는 배신하는 편이 낫다. 욕심 입니다.
- P > S: 상대가 배신할 때도 나는 배신하는 편이 낫다. 두려움 입니다.
- R > P: 그런데 둘 다 협력하는 것이 둘 다 배신하는 것보다 낫다. 이것이 없으면 딜레마가 아니라 그냥 배신하면 되는 게임입니다.
욕심과 두려움, 두 힘이 같은 방향(배신)을 가리키는 것이 죄수의 딜레마의 핵심입니다. Part 2 에서 보겠지만, 이 둘 중 하나만 빠져도 게임의 성격이 완전히 바뀝니다. 두려움(P > S)이 빠지면 “치킨 게임” 이 되고, 욕심(T > R)이 빠지면 “사슴 사냥” 이 됩니다.
반복해서 하는 게임에서는 조건이 하나 더 붙습니다.
2R > T + S
번갈아 배신하고 협력하는 것(한 번은 T, 한 번은 S)보다 계속 함께 협력하는 것(매번 R)이 더 나아야 한다는 뜻입니다. 액설로드의 점수로는 2 × 3 = 6 이 5 + 0 = 5 보다 크니 성립합니다. 이 조건이 없으면 두 사람이 “이번엔 내가, 다음엔 네가” 배신하기로 짜는 편이 협력보다 나아집니다.
6. 이름이 붙기까지#
6.1 RAND 연구소, 1950년#
이 게임을 처음 설계한 사람은 죄수 이야기를 만든 사람이 아닙니다. 1950년 초, 미국 공군의 싱크탱크인 RAND 연구소의 수학자5 메릴 플러드(Merrill Flood) 와 멜빈 드레셔(Melvin Dresher) 가 이 구조의 게임을 만들어 동료 두 사람에게 시켜 봤습니다. 경제학자 아먼 앨치언(Armen Alchian) 과 수학자 존 윌리엄스(John Williams) 였고, 같은 게임을 100번 이어서 두게 했습니다.
이론대로라면 두 사람은 매번 배신해야 합니다. 그런데 두 사람은 자주 협력했습니다. 이 결과를 들은 존 내쉬(John Nash)는, 같은 게임을 반복하는 경우에는 한 번만 하는 경우와 합리적인 행동이 다를 수 있다고 답했다고 전합니다. 협력은 한 번의 게임에서는 비합리적이어도 반복되는 관계에서는 나타날 수 있다는 것, 이것이 Part 3 의 주제입니다.
6.2 터커의 죄수 이야기#
같은 해, 내쉬의 지도교수였던 프린스턴대의 수학자 앨버트 터커(Albert W. Tucker) 가 스탠퍼드대 심리학자들에게 이 게임을 설명하면서 형량을 보수로 쓰는 죄수 이야기 를 붙였습니다. 수학자가 아닌 청중에게 행렬을 설명하기 위한 장치였습니다. “죄수의 딜레마” 라는 이름은 이 이야기에서 나왔습니다.
스탠퍼드 철학 백과사전은 한 가지를 덧붙입니다. 이 이름이 인쇄물에 처음 등장한 것은 1957년 루스(Luce)와 라이파(Raiffa)의 책 이고, 이름을 터커에게 돌리는 것은 흔하지만 정확하지 않을 수 있다는 것입니다. 이야기는 터커가 만들었고, 이름이 정착한 것은 그 뒤입니다.
6.3 왜 냉전기의 RAND 였나#
RAND 는 핵전략을 연구하던 곳입니다. 서로 핵무기를 늘리지 않으면 둘 다 안전하고 돈도 아끼지만, 상대가 늘릴 때 나만 멈추면 위험하고, 상대가 멈출 때 나만 늘리면 우위에 섭니다. 군비 경쟁 은 죄수의 딜레마의 교과서적인 사례이고, 이 게임이 그곳에서 만들어진 것은 우연이 아닙니다.
7. 현실 속의 죄수의 딜레마#
죄수의 딜레마는 “두 사람이 협력하면 둘 다 이득인데, 각자는 배신할 이유가 있는” 모든 상황에 붙는 이름이 됐습니다. 영문 위키백과가 드는 사례 몇 가지를 옮깁니다.
| 분야 | 협력 | 배신 | 왜 딜레마인가 |
|---|---|---|---|
| 국제 정치 — 안보 딜레마 | 군비를 늘리지 않는다 | 군비를 늘린다 | 내 안전을 위한 무장이 상대를 불안하게 해 맞무장을 부른다 |
| 스포츠 — 도핑 | 약물을 쓰지 않는다 | 약물을 쓴다 | 둘 다 쓰면 이점은 상쇄되고 건강·처벌의 위험만 남는다 |
| 환경 — 기후 | 배출을 줄인다 | 배출을 유지한다 | 모두가 안정된 기후의 이득을 보지만, 각국은 먼저 줄이기를 꺼린다 |
기후 문제에는 위키백과가 지적하는 차이가 하나 있습니다. 협력의 보수 자체가 불확실 하다는 점입니다. 죄수는 1년과 2년을 정확히 알지만, 각국은 감축의 효과를 정확히 모릅니다. 현실의 딜레마는 대개 교과서보다 흐릿합니다.
반대로 협력이 버티는 사례도 있습니다. 파운드스톤은 뉴질랜드에서 신문 판매함을 잠그지 않아도 돈을 내지 않고 가져가는 사람이 거의 없다는 이야기를 소개합니다. 2009년 노벨 경제학상을 받은 엘리너 오스트롬(Elinor Ostrom)은 공동체가 스스로 규칙을 만들고 지키며 공유 자원을 관리하는 사례를 모아, 배신이 언제나 필연은 아니라는 것을 보였습니다.
8. 딜레마를 푸는 다섯 가지 열쇠#
그렇다면 무엇이 붉은 칸에서 초록 칸으로 옮겨 주는가. 이 시리즈 전체를 관통하는 질문입니다. 미리 지도를 펼쳐 두면 이렇습니다.
flowchart TD
D["붉은 칸<br/>둘 다 배신"] --> K1["① 약속을 강제한다<br/>계약 · 감시 · 벌칙"]
D --> K2["② 다시 만나게 한다<br/>반복 게임"]
D --> K3["③ 남이 보게 한다<br/>평판"]
D --> K4["④ 보수를 바꾼다<br/>배신을 비싸게, 협력을 싸게"]
D --> K5["⑤ 상대를 나로 여긴다<br/>신뢰 · 정체성 · 의리"]
K1 --> C["초록 칸<br/>둘 다 협력"]
K2 --> C
K3 --> C
K4 --> C
K5 --> C
style D fill:#FF9999,color:#000000
style C fill:#90EE90,color:#000000
style K1 fill:#D3D3D3,color:#000000
style K2 fill:#87CEEB,color:#000000
style K3 fill:#87CEEB,color:#000000
style K4 fill:#FFD700,color:#000000
style K5 fill:#D3D3D3,color:#000000
- ① 약속을 강제한다. 경찰 앞의 죄수는 말을 나눌 수 없습니다. 말을 나눌 수 있어도 약속을 지키게 만들 장치가 없으면 소용이 없습니다. “협력하자” 는 말은 공짜이기 때문입니다. 서바이벌에서 참가자끼리 “둘 다 협력 누르자” 고 약속하는 장면이 늘 긴장되는 이유입니다. Part 4 의 게임쇼 연구가 이 “공짜 약속” 이 실제로 얼마나 효과가 있었는지를 숫자로 보여 줍니다.
- ② 다시 만나게 한다. 내일도 같은 사람과 같은 게임을 해야 한다면 오늘의 배신은 내일의 보복을 부릅니다. Part 3 의 주제입니다.
- ③ 남이 보게 한다. 두 사람만 보는 게임이 아니라 다른 참가자와 시청자가 보는 게임이라면, 배신한 사람은 다음 판에서 아무도 믿어 주지 않습니다. 서바이벌의 연합과 투표가 이 열쇠로 돌아갑니다.
- ④ 보수를 바꾼다. 배신하면 벌금을 물리거나, 협력하면 보너스를 주면 T > R > P > S 의 순서 자체가 바뀌어 더는 딜레마가 아닙니다. 서바이벌 제작진이 규칙 한 줄로 하는 일이 이것입니다. 그래서 같은 “협력/배신” 버튼이라도 보수가 조금만 다르면 다른 게임이 됩니다. Part 2 의 주제입니다.
- ⑤ 상대를 나로 여긴다. 죄수가 공범의 형량도 자기 일처럼 아낀다면 그는 더 이상 이 이야기의 죄수가 아닙니다. 1절의 전제(“자기 형량만 신경 쓴다”)가 깨진 것입니다. 친구, 가족, 같은 팀이 서바이벌에서 강한 이유입니다.
마치며#
죄수의 딜레마를 한 문장으로 줄이면 “욕심과 두려움이 같은 방향을 가리킬 때, 각자 옳은 선택이 모두를 망친다” 입니다. 조건은 T > R > P > S 하나이고, 결말은 모두가 배신하는 유일한 균형입니다.
그런데 서바이벌의 “협력/배신” 게임을 이 조건에 대어 보면, 부등호 하나가 등호이거나 방향이 반대인 경우가 많습니다. 그것만으로 정답이 바뀝니다. 다음 편은 죄수의 딜레마와 닮았지만 다른 게임들, 그리고 “이 게임이 진짜 죄수의 딜레마인가” 를 가르는 방법입니다.
| 편 | 주제 |
|---|---|
| Part 1 (이 글) | 죄수의 딜레마란 무엇인가 |
| Part 2 | 닮았지만 다른 게임들 |
| Part 3 | 다시 만난다면 — 반복 게임과 팃포탯 |
| Part 4 | 게임쇼의 딜레마 |
| Part 5 | 한국·일본 서바이벌의 딜레마 |
| Part 6 | 영화·드라마·애니메이션·게임 속 딜레마 |
References#
- Prisoner’s dilemma — Wikipedia — 파운드스톤 판본, 보수 행렬, 일반형 조건, 현실 사례
- Steven Kuhn, Prisoner’s Dilemma — Stanford Encyclopedia of Philosophy — 플러드·드레셔의 1950년 실험, 터커의 이야기, 이름의 첫 인쇄(루스·라이파 1957), 조건식
- William Poundstone, Prisoner’s Dilemma: John von Neumann, Game Theory, and the Puzzle of the Bomb (Doubleday, 1992) — 오늘날의 표준 판본, RAND 와 냉전, 뉴질랜드 신문함. 위키백과는 1993년 판을 인용합니다
- R. Axelrod & W. D. Hamilton, The Evolution of Cooperation, Science 211 (1981) — T=5, R=3, P=1, S=0
- Tragedy of the commons — Wikipedia — 오스트롬의 공유 자원 관리 연구
보수 행렬(payoff matrix): 각 사람이 고를 수 있는 선택을 행과 열에 놓고, 두 선택이 만나는 칸에 각자가 받는 결과(보수)를 적은 표입니다. 게임 하나를 한눈에 보여 줍니다. ↩︎
우월 전략(dominant strategy): 상대가 무엇을 고르든 다른 선택보다 언제나 더 나은 결과를 주는 선택입니다. 언제나 “엄격하게” 낫다면 강우월, 어떤 경우에는 “같고” 나머지 경우에 낫다면 약우월이라고 합니다. 이 차이가 Part 2 의 게임쇼 분석에서 중요해집니다. ↩︎
내쉬 균형(Nash equilibrium): 다른 모두가 지금 선택을 그대로 둔다면, 누구도 자기 선택만 바꿔서 이득을 볼 수 없는 상태입니다. 수학자 존 내쉬가 1950년에 정식화했고, 이 공로로 1994년 노벨 경제학상을 받았습니다. ↩︎
파레토 효율(Pareto efficiency): 누군가를 더 좋게 만들려면 반드시 다른 누군가를 더 나쁘게 만들어야 하는 상태입니다. 아무도 손해 보지 않고 누군가를 더 좋게 만들 수 있다면 아직 효율적이지 않은 것입니다. 이탈리아 경제학자 빌프레도 파레토의 이름에서 왔습니다. ↩︎
RAND 연구소: 1948년 미국 공군의 지원으로 세워진 싱크탱크입니다. 이름은 연구 개발(Research ANd Development)에서 왔고, 냉전기 핵전략과 게임 이론 연구의 중심지였습니다. ↩︎