데이터 리터러시 · 10.2

‘가장 많이 오른 주식’ 뒤에 숨겨진 진실

“10년 전에 샀다면 얼마?” 계산은 맞다. 다만 그 사이 사라진 기업은 데이터에 없다. 숫자가 정확해도 데이터셋은 편향될 수 있다.

“10년 전에 이 주식에 1,000만 원을 넣었다면 지금은 얼마일까?”

투자 콘텐츠에서 정말 자주 보는 문장이다.

누구나 한 번쯤 계산해본다.

‘그때 1,000만 원만 넣었어도….’

차트를 보면 더 아쉽다. 왼쪽 아래에서 시작한 선이 오른쪽 위까지 가파르게 올라가 있다. 지금 보면 너무 명확하다.

“이렇게 좋은 회사를 왜 그때 몰랐을까?”

그런데 데이터 리터러시의 관점에서 보면 이 질문에는 꽤 큰 문제가 하나 숨어 있다.

우리는 왜 하필 이 회사의 데이터를 보고 있을까?

지금까지 살아남았고, 크게 성장했고, 그래서 사람들의 관심을 받았기 때문이다.

반대로 같은 시기에 투자할 수 있었지만 실적이 나빠진 기업, 상장폐지된 기업, 경쟁에서 밀려난 기업은 이런 콘텐츠에 거의 등장하지 않는다.

즉 우리가 보고 있는 데이터는 과거 전체가 아니다.

현재까지 살아남아 눈에 보이는 데이터만 모아놓은 결과일 수 있다.

이것이 바로 데이터 리터러시에서 생존자 편향이 중요한 이유다.

생존자 편향의 핵심은 ‘성공한 사람만 본다’가 아니다

생존자 편향이라는 말을 들으면 흔히 이런 사례를 떠올린다.

“성공한 사람만 보고 성공 공식을 만들면 안 된다.”

맞는 말이다.

하지만 데이터 리터러시에서는 한 단계 더 들어가야 한다.

생존자 편향의 진짜 문제는 분석할 데이터가 만들어지는 과정에서 일부 데이터가 사라졌다는 사실을 알아차리지 못하는 것이다.

예를 들어 10년 전 비슷한 산업에 100개의 기업이 있었다고 해보자.

10년 뒤 20개 기업은 크게 성장했고, 30개는 그럭저럭 살아남았고, 나머지 50개는 인수되거나 사업이 축소되거나 시장에서 사라졌다고 가정해보자.

그런데 우리가 현재 금융 사이트에서 ‘10년 장기 성과’를 분석하면서 지금도 거래되는 50개 기업만 본다면 어떻게 될까?

분석 대상 자체가 이미 달라져 있다.

처음에는 100개였는데 현재 데이터에서는 50개만 남아 있다.

그 상태에서 평균 수익률을 계산하면 실제 당시 투자자가 마주했던 선택 환경보다 결과가 좋아 보일 가능성이 있다.

여기서 중요한 것은 투자 이야기가 아니다.

데이터를 분석하기 전에 ‘누가 데이터에 남아 있는가?’를 확인해야 한다는 원칙이다.

데이터는 과거를 그대로 보존하지 않는다

우리는 과거 데이터를 보면 과거 현실을 그대로 보고 있다고 생각하기 쉽다.

하지만 데이터베이스에는 현재까지 남아 있는 것만 기록되어 있을 수 있다.

회사를 예로 들어보자.

“우리 회사 장기근속자들의 공통점을 분석해보니 적극적인 성향이 많았다.”

그래서 회사가 결론을 내린다.

“적극적인 사람을 채용하면 장기근속 가능성이 높겠군.”

그런데 분석 대상이 현재까지 회사에 남아 있는 직원뿐이라면?

이미 퇴사한 직원의 데이터가 빠져 있다면?

특히 적극적인 성향이었지만 조직과 맞지 않아 일찍 퇴사한 사람들이 많았다면 결론은 완전히 달라질 수 있다.

문제는 분석 방법이 틀린 것이 아니다.

평균도 정확하고 비율 계산도 정확할 수 있다.

분석에 들어간 데이터셋 자체가 현실의 일부만 포함하고 있는 것이 문제다.

이것이 데이터 리터러시에서 굉장히 중요한 포인트다.

우리는 보통 숫자가 맞는지 확인한다.

하지만 그보다 먼저 확인해야 할 것이 있다.

“이 숫자를 만드는 과정에서 누가 빠졌는가?”

‘현재 고객 분석’에서도 같은 일이 벌어진다

이 문제는 투자와 회사 데이터에만 있는 것이 아니다.

마케팅에서도 자주 발생한다.

어떤 쇼핑몰이 우수 고객 1,000명을 분석했다고 해보자.

분석 결과 40대 고객이 많고, 객단가가 높고, 특정 상품을 자주 구매한다는 특징이 나타났다.

회사는 이 데이터를 바탕으로 앞으로 40대 고객에게 마케팅을 집중한다.

그런데 한 가지 데이터가 빠졌다.

지난 1년 동안 떠난 고객이다.

20~30대 고객이 상품이나 서비스에 불편을 느껴 대거 이탈했다면 현재 고객만 분석한 결과에서는 그들이 보이지 않는다.

그러면 회사는 이렇게 해석할 수 있다.

“우리 제품은 원래 40대가 좋아한다.”

하지만 실제로는

“20~30대 고객을 제대로 붙잡지 못했다”

일 수도 있다.

두 문장은 완전히 다른 전략을 만든다.

첫 번째 결론이라면 40대 마케팅을 강화할 것이다.

두 번째 결론이라면 20~30대가 왜 떠났는지 분석해야 한다.

어떤 데이터를 포함하느냐가 결국 의사결정까지 바꾼다.

그래서 데이터 리터러시는 ‘숫자를 읽는 능력’에서 끝나지 않는다

여기서 데이터 리터러시에 대한 중요한 오해 하나를 정리할 필요가 있다.

많은 사람이 데이터 리터러시를 이렇게 생각한다.

  • 그래프를 읽는 능력
  • 평균과 중앙값을 구분하는 능력
  • 퍼센트를 제대로 계산하는 능력
  • 통계를 이해하는 능력

물론 모두 중요하다.

하지만 그것만으로는 부족하다.

아무리 정확하게 계산해도 입력된 데이터가 현실의 일부만 보여준다면 결과 역시 일부의 현실만 설명한다.

그래서 데이터 리터러시에는 한 가지 질문이 더 필요하다.

“내가 지금 보고 있는 데이터는 어떤 과정을 거쳐 여기까지 살아남았을까?”

이 질문을 하기 시작하면 숫자가 다르게 보인다.

‘성공한 창업가 100명의 공통점’을 보면 실패한 창업가는 조사에 포함됐는지 궁금해진다.

‘장기근속자의 특징’을 보면 퇴사자는 포함됐는지 묻게 된다.

‘베스트셀러 상품 구매자의 특징’을 보면 구매하지 않은 사람과 구매 후 떠난 사람은 어디에 있는지 생각하게 된다.

‘수익률 상위 펀드’를 보면 사라진 펀드는 비교 대상에 포함됐는지 궁금해진다.

이것이 생존자 편향을 투자 상식이 아니라 데이터를 읽는 기술로 이해하는 방법이다.

‘가장 많이 오른 주식’을 다시 보자

이제 처음 질문으로 돌아가보자.

“10년 전에 이 주식에 1,000만 원을 넣었다면?”

계산 자체는 틀리지 않았다.

하지만 데이터 리터러시가 있는 사람이라면 여기서 질문을 하나 더 붙인다.

“그 당시 선택할 수 있었던 다른 종목들은 어떻게 됐을까?”

이 질문이 들어가는 순간 하나의 성공 사례가 ‘전체 시장을 대표하는 데이터’에서 ‘여러 결과 중 하나의 사례’로 바뀐다.

그리고 바로 이 지점에서 투자 데이터를 보는 방식도 달라진다.

현재 살아남은 승자를 보고 과거의 선택이 쉬웠다고 착각하지 않는다.

결과를 알고 난 뒤 원인을 끼워 맞추지도 않는다.

무엇보다 보이는 데이터만으로 전체를 판단하지 않는다.

데이터에서 ‘없는 사람’을 찾아보자

생존자 편향을 발견하는 가장 쉬운 방법은 데이터에 있는 것을 보는 것이 아니라 없는 것을 찾는 것이다.

다음과 같은 문장을 만났다고 해보자.

“성공한 CEO의 80%가 아침 일찍 일어난다.”

그렇다면 질문한다.

“실패한 CEO 중에는 아침 일찍 일어나는 사람이 얼마나 될까?”

“우리 서비스를 계속 사용하는 고객의 만족도는 92%다.”

그러면 묻는다.

“이미 서비스를 해지한 고객은 조사에 포함됐을까?”

“10년 이상 근속한 직원의 조직 만족도가 높다.”

여기에서도 질문한다.

“불만족해서 일찍 떠난 사람은 어디에 있지?”

이 질문 하나가 데이터의 시야를 넓혀준다.

숫자가 정확해도 데이터셋은 편향될 수 있다

이것이 생존자 편향에서 가장 기억해야 할 문장이다.

숫자가 틀리지 않아도 결론은 틀릴 수 있다.

계산은 완벽할 수 있다.

그래프도 정확할 수 있다.

통계 프로그램도 오류 없이 작동했을 수 있다.

하지만 분석 대상에 특정 집단만 남아 있다면 결론은 현실을 왜곡할 수 있다.

그래서 데이터 리터러시가 있는 사람은 결과를 보기 전에 데이터가 만들어진 과정을 살핀다.

누가 포함됐는가?

누가 빠졌는가?

중간에 사라진 데이터는 없는가?

현재 남아 있는 사람만 보고 있지는 않은가?

이 네 질문은 투자뿐 아니라 고객 분석, 조직 데이터, 교육, 의료, 마케팅 등 거의 모든 데이터 분석에 적용할 수 있다.

이 글에서 기억할 한 가지

‘가장 많이 오른 주식’을 보지 말라는 이야기가 아니다.

성공 사례는 분명 배울 것이 있다.

다만 성공 사례를 전체 데이터처럼 읽지 않는 것이 중요하다.

우리가 보고 있는 숫자는 언제나 어떤 선택과 수집 과정을 거쳐 만들어진다.

그리고 때로는 그 과정에서 사라진 데이터가, 지금 눈앞에 남아 있는 데이터보다 더 중요한 이야기를 들려준다.

데이터를 잘 읽는 사람은 무엇이 보이는지만 확인하지 않는다. 왜 이것만 보이고, 무엇이 사라졌는지를 함께 본다.

그 순간 생존자 편향은 단순한 투자 상식이 아니라 데이터 리터러시의 핵심 질문이 된다.

“이 데이터에서 빠진 것은 무엇인가?”