이 글은 Claude Opus 5 를 이용해 초안이 작성되었으며, 이후 퇴고를 거쳤습니다.


Part 1에서는 빅 파이브가 어떻게 발견되었고 다섯 요인이 각각 무엇을 재는지 봤습니다. 이번 편은 비교입니다.

비교라고 하면 대개 “MBTI는 비과학, 빅 파이브는 과학"으로 끝나는데, 그렇게 정리하면 재미도 없고 정확하지도 않습니다. 실제로는 두 도구가 상당히 많이 겹칩니다. 흥미로운 부분은 겹치는 지점이 아니라 어긋나는 지점이고, 어긋나는 이유가 대부분 구조 에서 옵니다.

순서는 이렇습니다. 구조를 먼저 보고, 얼마나 겹치는지 숫자로 확인하고, 신뢰도와 예측력을 같은 자에 올린 뒤, 마지막에 두 가지 현실 — MBTI 발행사가 자기 문서에 뭐라고 적어 놓았는지, 그리고 한국 기업이 채용에서 실제로 얼마나 쓰는지 — 를 보겠습니다.


1. 두 조각으로 자를 때 버려지는 것#

MBTI는 네 개의 축에서 각각 한쪽을 고르게 합니다. 2 × 2 × 2 × 2 = 16. 빅 파이브는 다섯 개의 축에서 각각 점수 를 냅니다. 유형이 없고 좌표만 있습니다.

이 차이를 “MBTI는 대충, 빅 파이브는 정밀"로 요약하면 절반만 맞습니다. 실제로 벌어지는 일은 더 구체적입니다.

MBTI 검사도 내부적으로는 연속 점수를 계산합니다. 그런 다음 가운데를 잘라 T인지 F인지 정합니다. 이 절단이 두 가지 일을 동시에 합니다.

첫째, 거리를 지웁니다. 사고 성향이 51%인 사람과 99%인 사람이 똑같이 “T"가 됩니다. 둘 사이의 거리가 결과에서 완전히 사라집니다.

둘째, 가까운 것을 갈라놓습니다. 51%인 사람과 49%인 사람은 사실상 같은 지점에 있는데, 한 명은 T가 되고 한 명은 F가 됩니다. 그리고 이 두 사람이 다음 주에 검사를 다시 받으면 서로 자리를 바꿀 수 있습니다.

flowchart LR
    P1["응답자 A<br/>사고 성향 51%"]:::mid
    T1["MBTI 결과<br/>T"]:::cat
    B1["빅 파이브<br/>우호성 백분위 50"]:::dim
    P2["응답자 B<br/>사고 성향 99%"]:::high
    T2["MBTI 결과<br/>T"]:::cat
    B2["빅 파이브<br/>우호성 백분위 2"]:::dim
    P3["응답자 C<br/>사고 성향 49%"]:::mid
    T3["MBTI 결과<br/>F"]:::catf
    B3["빅 파이브<br/>우호성 백분위 52"]:::dim
    P1 --> T1
    P1 --> B1
    P2 --> T2
    P2 --> B2
    P3 --> T3
    P3 --> B3
    classDef mid fill:#FFD700,color:#000000
    classDef high fill:#FFA07A,color:#000000
    classDef cat fill:#87CEEB,color:#000000
    classDef catf fill:#FF9999,color:#000000
    classDef dim fill:#90EE90,color:#000000

A와 B는 MBTI에서 같은 글자를 받지만 빅 파이브에서는 백분위 50과 2로 갈립니다. A와 C는 MBTI에서 다른 글자를 받지만 빅 파이브에서는 사실상 같은 자리입니다. 두 번 다 MBTI 쪽이 정보를 잘못 다루고 있습니다.

그런데 이건 결함이라기보다 거래(trade-off)입니다. 잘라내는 대가로 얻는 것이 있습니다. 말할 수 있는 이름 입니다. “저는 성실성 백분위 63, 신경성 백분위 41입니다"라고 자기소개를 하는 사람은 없습니다. “저 ENFP예요"는 됩니다. MBTI가 이긴 싸움이 있다면 정확성이 아니라 전달력 이고, 그건 사소한 승리가 아닙니다.


2. 실제로 얼마나 겹치는가#

두 도구가 같은 것을 재고 있는지 확인하려면, 같은 사람들에게 두 검사를 다 받게 하고 상관을 보면 됩니다. 1989년 맥크레이와 코스타가 그렇게 했습니다(19~93세 남성 267명·여성 201명, NEO-PI 자기보고와 타인평정 병행).

널리 인용되는 결과는 이렇습니다. MBTI의 네 축이 빅 파이브의 네 요인과 각각 대응 합니다.

MBTI 축대응하는 빅 파이브 요인관계의 강도
E ~ I (외향 ~ 내향)외향성매우 강함 (약 .74)
S ~ N (감각 ~ 직관)개방성매우 강함 (약 .72)
T ~ F (사고 ~ 감정)우호성중간 (약 .44)
J ~ P (판단 ~ 인식)성실성중간 (약 .49)
—신경성대응 없음

부호는 채점 방향에 따라 음수로 표기되는데(I·N·F·P 방향으로 채점하면 외향성·성실성과 음의 상관), 방향 문제일 뿐 관계의 강도는 표의 절댓값과 같습니다. 이 논문은 유료라 표를 직접 열람하지 못했고, 위 값은 다수의 2차 문헌이 일관되게 보고하는 수치입니다.

여기서 세 가지를 읽어야 합니다.

첫째, MBTI는 헛것을 재고 있지 않습니다. E ~ I와 S ~ N은 상관 .7대입니다. 이 정도면 “같은 것을 조금 다른 방식으로 재고 있다"고 말해도 됩니다. MBTI를 “별자리와 같다"고 말하는 흔한 비유는 정확하지 않습니다. 별자리는 성격과 상관이 0에 가깝습니다.

둘째, T ~ F와 J ~ P는 생각보다 헐겁습니다. .44와 .49면 겹치는 분산이 20~25% 수준입니다. 특히 T ~ F를 “우호성"이라고 부르면 어색한데, MBTI 이론이 이 축을 “판단의 기준"으로 정의하는 반면 우호성은 “타인의 이해관계를 어떻게 다루는가"이기 때문입니다. 완전히 같은 것이 아닙니다.

셋째, 그리고 이것이 핵심인데 — 신경성이 통째로 없습니다.

Part 1에서 말한 그 문제입니다. 다시 정리하면 이렇습니다. MBTI의 네 축은 빅 파이브 다섯 중 넷에 대응하고, 남는 하나가 삶의 결과와의 연관이 가장 꾸준히 보고되는 요인 입니다. 불안, 우울, 스트레스 취약성, 정서적 회복력이 여기 들어 있습니다.

그러니 MBTI 결과지가 아무리 상세해도, 그 안에는 “당신이 스트레스에 얼마나 취약한가"에 대한 정보가 원리적으로 담길 수 없습니다. 사람들이 성격 검사에서 가장 알고 싶어 하는 것 중 하나가 빠져 있는 셈입니다.


3. 신뢰도: 두 개의 숫자를 어떻게 읽을 것인가#

여기서부터 조금 조심스럽게 가겠습니다. 인터넷의 MBTI 비판 글은 대개 “5주 안에 절반이 다른 유형으로 바뀐다"를 인용하고 끝냅니다. 그런데 MBTI 발행사인 마이어스-브릭스 컴퍼니는 자사 공식 자료에서 정반대로 보이는 숫자 를 제시합니다. 양쪽을 다 놓고 보겠습니다.

지표값출처
빅 파이브 재검사 신뢰도 중앙값.816 (간격 최대 2개월)Gnambs (2014) 메타분석. 74개 표본, 14,923명, 682개 상관
MBTI 4개 선호의 평균 재검사 계수.87 (간격 최대 15주)The Myers-Briggs Company 공식 인포그래픽. MBTI 매뉴얼 171쪽 인용
MBTI 유형(네 글자) 변경 비율5주 내 39~76% 가 최소 한 글자 변경여러 재검사 연구

숫자만 보면 MBTI가 오히려 높습니다. 이게 어떻게 된 일일까요.

모순이 아닙니다. 두 숫자가 서로 다른 것을 재고 있습니다.

  • .87은 연속 점수의 상관 입니다. “지난번에 사고 쪽 점수가 높았던 사람이 이번에도 높은가"를 봅니다.
  • 39~76%는 범주의 일치율 입니다. “지난번에 T였던 사람이 이번에도 T인가"를 봅니다.

앞 절의 그림이 그대로 설명해 줍니다. 점수가 아주 안정적이어도, 그 점수가 경계선 근처에 몰려 있으면 범주는 쉽게 뒤집힙니다. 51에서 49로 2점만 움직여도 글자가 바뀝니다. 그리고 실제 성격 특성은 정규분포에 가까워서 경계선인 중앙 부근에 사람이 가장 많이 몰려 있습니다.

즉 발행사의 .87은 거짓말이 아니고, 비판자의 39~76%도 거짓말이 아닙니다. 둘 다 사실이고, 그 둘이 동시에 사실인 이유가 바로 이분법이라는 구조입니다. MBTI 비판의 정확한 형태는 “검사가 엉터리다"가 아니라 “쓸 만한 측정을 해 놓고 마지막 단계에서 그 정보를 버린다"입니다.

빅 파이브는 이 마지막 단계를 하지 않습니다. 그래서 이런 종류의 불안정이 아예 생기지 않습니다.


4. 예측 타당도: 빅 파이브도 마법은 아닙니다#

신뢰도가 “같은 답이 나오는가"라면, 타당도는 “그 답이 뭔가를 말해주는가"입니다. 여기서는 빅 파이브 쪽 숫자를 정직하게 깎아서 보겠습니다.

재현은 됩니다#

2019년 크리스토퍼 소토가 이끈 Life Outcomes of Personality Replication 프로젝트 는 기존에 발표된 특질-결과 연관 78개를 사전등록하고 고출력으로 재현했습니다(표본 크기 중앙값 1,504명).

  • 87% 가 기대한 방향에서 통계적으로 유의했습니다
  • 다만 재현된 효과의 크기는 원래 보고된 효과의 약 77% 수준이었습니다

심리학의 재현성 위기를 감안하면 87%는 좋은 성적입니다. 동시에 “원래 보고보다 4분의 1쯤 작다"는 단서도 함께 기억해야 합니다.

크기는 SES·인지능력과 비슷합니다#

2007년 로버츠 등은 사망률, 이혼, 직업적 성취라는 세 가지 결과에 대해 성격 특질의 예측력을 사회경제적 지위(SES) 및 인지능력의 예측력과 비교 했습니다. 전향적 종단 연구만 골라 배경 변수를 통제한 결과, 성격의 효과 크기는 SES나 인지능력의 효과 크기와 구별되지 않는 수준 이었습니다.

이건 양날의 결론입니다. “성격이 그만큼 중요하다"로 읽을 수도 있고, “SES나 IQ도 그렇게까지 결정적이지는 않다"로 읽을 수도 있습니다. 두 해석 다 맞습니다.

그런데 채용 장면에서는 생각보다 작습니다#

2022년 색켓 등은 인사 선발 문헌의 오랜 관행 — 범위 제한(range restriction) 교정 — 이 체계적으로 과대 교정을 해 왔다고 지적하고, 주요 선발 도구의 타당도를 다시 계산했습니다. 결과는 전반적으로 .10~.20 하락 이었습니다.

성실성 검사의 직무 성과 예측 타당도는 .19 였습니다. 상관 .19면 설명되는 분산이 4% 미만입니다. 이 재계산에서 1위로 올라선 것은 성격 검사가 아니라 구조화 면접이었습니다.

이 숫자를 굳이 적는 이유가 있습니다. 빅 파이브를 소개하는 글은 대개 “MBTI와 달리 예측 타당도가 높다"에서 멈추는데, 여기서 멈추면 다음 단계 오해로 이어집니다. “그럼 빅 파이브로 사람을 뽑으면 되겠네” 입니다.

정확한 진술은 이렇습니다. 빅 파이브는 MBTI보다 낫습니다. 그리고 절대적으로는, 개인의 미래를 판정할 만큼 크지 않습니다.


5. 발행사가 직접 적어 놓은 금지 목록#

MBTI 비판 중에 가장 힘이 센 것은 외부 학자의 논문이 아니라 발행사 자신의 문서 입니다.

마이어스-브릭스 컴퍼니가 배포하는 「Scientifically valid or not?」 인포그래픽에는 MBTI의 용도가 두 목록으로 나뉘어 있습니다. 원문 그대로 옮깁니다.

What it is for: Self-awareness / Personal development / Professional development / Improving communication / Team building / Stress management / Change management / Leadership development

What it’s not for: Hiring / Selecting teams / Firing / Predicting performance / Predicting the future

채용, 팀 배정, 해고, 성과 예측, 미래 예측. 다섯 항목이 전부 “이 도구는 그 용도가 아니다"에 들어 있습니다. 이 문서를 만든 곳은 MBTI로 수익을 내는 회사입니다. 판매자가 스스로 그어 놓은 선이라는 점에서 오히려 무게가 있습니다.

그러니 “MBTI로 사람을 뽑는 게 문제인가"라는 질문은 학계와 발행사 사이에 이견이 없는 사안입니다. 양쪽 다 하지 말라고 합니다.


6. 그런데 한국 기업은 실제로 얼마나 쓸까#

체감으로는 “요즘 다들 채용에 MBTI 본다"입니다. 실제 조사 수치는 다릅니다.

고용노동부와 한국고용정보원이 2022년 3~5월 에 매출액 500대 기업 252곳과 중견기업 500곳 등 752개사 채용담당자를 조사했습니다.

항목결과
채용 과정에서 MBTI를 활용하는 기업3.1% (23개사)
MBTI 유형이 채용에 보통 이상의 영향을 준다는 응답2.3% (17개사)
신입 채용에서 가장 중요한 평가 요소직무 관련 근무 경험(34.4%), 전공의 직무 관련성(33.9%)

97%가 쓰지 않습니다. 여기에는 단서가 둘 붙습니다.

첫째, 2022년 자료 입니다. 이 글을 쓰는 2026년 8월 기준으로 4년 전 조사이고, 같은 설계의 최신 조사를 찾지 못했습니다. 그 사이 늘었을 수도 줄었을 수도 있습니다.

둘째, 조사 대상이 대기업과 중견기업 입니다. 당시 전문가들도 소규모 사업장이나 아르바이트 구인 시장에서는 활용률이 더 높을 수 있다고 단서를 달았습니다. 실제로 “INFP는 지원 불가” 같은 채용 공고가 논란이 된 사례들은 대부분 이쪽에서 나왔습니다.

그래도 방향은 분명합니다. 구직자가 느끼는 공포와 실제 관행 사이에 큰 간극이 있습니다. MBTI 때문에 떨어질까 걱정하며 유형을 위조하는 것보다, 직무 경험을 정리하는 데 시간을 쓰는 편이 통계적으로 훨씬 합리적입니다.


7. 당신은 이미 빅 파이브 검사를 받았을지도 모릅니다#

선행 글에서도 짚었지만 다시 확인해 둘 가치가 있습니다. 한국에서 “MBTI 검사"로 통하는 무료 사이트 대부분은 공식 MBTI가 아니라 16Personalities 입니다. 이 회사가 자사 이론 문서에 적어 놓은 문장이 흥미롭습니다.

Unlike Myers-Briggs or other theories based on the Jungian model, we have not incorporated Jungian concepts such as cognitive functions… we’ve instead chosen to rework and rebalance the dimensions of personality called the Big Five personality traits.

(마이어스-브릭스나 융 모델에 기반한 다른 이론과 달리, 우리는 인지 기능 같은 융의 개념을 도입하지 않았습니다. 대신 빅 파이브 성격 특질이라 불리는 차원들을 재구성하고 재조정하는 쪽을 택했습니다.)

즉 16Personalities는 자기들이 MBTI 계열이 아니라 빅 파이브 계열이라고 명시적으로 밝히고 있습니다. 네 글자 표기법과 유형 이름만 MBTI에서 빌려 왔을 뿐입니다.

그래서 다섯 번째 글자 -A/-T(Assertive/Turbulent) 가 붙어 있는 것입니다. 이 축이 대략 신경성에 대응합니다. MBTI에 없는 그 축을, 빅 파이브에서 출발한 이 검사는 가지고 있습니다.

정리하면 이렇게 됩니다. 한국에서 “MBTI 열풍"이라 불리는 현상의 상당 부분은 실은 빅 파이브 기반 검사에 MBTI 라벨이 붙어 유통된 것 입니다. 다만 16Personalities가 빅 파이브에서 출발했다는 사실이 그 검사의 타당도를 보증하지는 않습니다. 문항과 채점 방식이 공개·검증되지 않았고, 결국 다시 네 글자로 잘라서 보여주기 때문에 앞서 본 절단 문제도 그대로 안고 있습니다.


정리#

비교 축MBTI빅 파이브
만들어진 방향융 이론에서 연역어휘·질문지 데이터에서 귀납
결과의 형태16개 범주5개(또는 30개) 연속 점수
다루는 차원4개5개 — 신경성 포함
재검사연속 점수 .87, 그러나 유형은 5주 내 39~76%가 변동중앙값 .816, 범주 절단이 없어 이런 변동이 발생하지 않음
예측 타당도연구가 적고 결과도 약함재현율 87%, 다만 효과 크기는 흔히 알려진 것보다 작음
채용 사용발행사가 명시적으로 금지가능하지만 타당도 .19 수준이고 응답 위장 문제가 있음
접근성·전달력압도적낮음

한 문장으로 줄이면 이렇습니다. MBTI는 실재하는 것을 재고 있고, 잰 다음에 그 정보를 버립니다.

Part 3에서는 반대편에서 접근하겠습니다. 그렇게 유형이 좋다면, 빅 파이브 데이터에서 유형을 뽑아내면 되지 않을까. 실제로 150만 명 데이터로 그 시도를 한 논문이 있고, 그 논문에 붙은 반론이 있고, 저자들의 답변이 있습니다. 결말이 꽤 흥미롭습니다.


References#

주요 1차 문헌

  • McCrae, R. R., & Costa, P. T. (1989). Reinterpreting the Myers-Briggs Type Indicator from the perspective of the Five-Factor model of personality. Journal of Personality 57, 17–40. https://doi.org/10.1111/j.1467-6494.1989.tb00759.x — 본문 유료. 서지와 표본(남 267명·여 201명, 19~93세)만 확인했고, 상관계수는 다수의 2차 문헌이 일관되게 보고하는 값을 사용했습니다.
  • Gnambs, T. (2014). A meta-analysis of dependability coefficients (test–retest reliabilities) for measures of the Big Five. Journal of Research in Personality 52, 20–28. — 74개 표본, N=14,923, 재검사 신뢰도 중앙값 ρ = .816.
  • Soto, C. J. (2019). How replicable are links between personality traits and consequential life outcomes? The Life Outcomes of Personality Replication Project. Psychological Science 30(5), 711–727. https://pubmed.ncbi.nlm.nih.gov/30950321/ — 사전등록 고출력 재현 연구. 78개 연관, 표본 크기 중앙값 1,504명.
  • Roberts, B. W., Kuncel, N. R., Shiner, R., Caspi, A., & Goldberg, L. R. (2007). The Power of Personality: The Comparative Validity of Personality Traits, Socioeconomic Status, and Cognitive Ability for Predicting Important Life Outcomes. Perspectives on Psychological Science 2, 313–345. https://projects.ori.org/lrg/PDFs_papers/Roberts_etal_2007_Power_of_personality_PPS.pdf — 저자 소속 기관 공개 PDF.
  • Sackett, P. R., Zhang, C., Berry, C. M., & Lievens, F. (2022). Revisiting meta-analytic estimates of validity in personnel selection: Addressing systematic overcorrection for restriction of range. Journal of Applied Psychology 107(11), 2040–2068. https://pubmed.ncbi.nlm.nih.gov/34968080/

1차 자료 (발행사·조사기관)

참고