DATA LITERACY
데이터 리터러시
숫자가 우리를 설득하는 방식을 한 편씩 다시 읽는다
41편
여는 글
1장
이 숫자, 진짜일까?
매출이 200% 늘었다는데, 진짜 대박일까?
“이 브랜드, 작년보다 매출이 200% 늘었대!” 이 한 문장만으로 우리는 쉽게 '성공'이라는 단어를 떠올린다.
평균의 함정: 내 월급은 왜 항상 평균보다 낮을까?
평균은 ‘보통’이 아니다. 소득처럼 편차가 큰 데이터에서는 극단값 하나가 평균을 끌어올려, 대부분이 평균 아래에 남는다. 중앙값(중위소득)을 함께 봐야 내 자리가 보인다.
97%가 만족? 그 3%가 될 수 있는 나
만족도 97%짜리 후기는 대개 만족한 사람만 남긴 것이다. 남기지 않은 3%가 어디로 갔는지는 아무도 세지 않는다.
표본, 샘플, 응답률 — 누구 말을 믿을까?
설문 수치는 ‘몇 명이 그랬나’보다 ‘그 몇 명이 누구였나’에 달려 있다. 응답률이 낮으면 답하지 않은 사람들의 성향이 통째로 빠진다 — 비응답 편향.
2장
그래프는 거짓말을 하지 않는다?
Y축만 깎았을 뿐인데 매출이 폭등했다
Y축 시작점을 0이 아닌 곳에 두면 같은 숫자가 완만한 성장에서 폭등으로 바뀐다. 'Y축 자르기'는 수치를 하나도 틀리지 않고 인상만 바꾸는 기술이다.
누적 그래프와 막대 그래프 사이의 간극
누적 그래프는 절대 내려가지 않는다. 그래서 성장이 멈춘 달에도 여전히 우상향으로 보인다.
이중축 그래프, 도대체 뭘 비교하자는 거지?
한눈에 보면 뭔가 있어 보인다. “오, 가입자가 늘면서 매출도 같이 오르네?” “가입자 수가 줄자 매출도 떨어졌네?”
그래프는 보여주는 게 아니라 숨기는 도구일 때가 많다
회사 회의 시간, 팀장이 자료를 띄운다. PPT 8페이지에 딱 있는 그래프 하나.
3장
데이터가 객관적이지 않은 이유
선택적 수치, 보고 싶은 것만 보는 리포트
‘사실’을 말한다고 생각했다. 매출이 늘었고, 전환율이 높아졌고, 고객 이탈률은 개선됐다고 했다.
누가 데이터를 만들었는가: 기관, 기업, 언론의 의도
“2030 세대의 72%, 연애보다 혼자가 편하다 응답” 기사 안에는 그래프도 있었고, 퍼센트도 있었다.
데이터는 중립적이지 않다: 왜 수치는 편향될 수밖에 없는가
데이터는 중립적이지 않다. 무엇을 물을지, 어떻게 모을지, 어디로 분류할지마다 사람의 선택이 들어가기 때문이다. 그 편향은 대개 고의가 아니라서 더 안 보인다.
팩트가 많을수록 진실에 가까워질까?
데이터가 많을수록 판단이 정확해진다는 믿음. 그런데 팩트를 쌓는 일과 진실에 다가가는 일은 같지 않다.
4장
클릭하는 순간, 데이터는 나를 읽는다
추천 알고리즘은 왜 내 취향을 이렇게 잘 알까?
우리는 지금, 내가 클릭한 순간, 나보다 먼저 나를 해석하고 예측하는 세상에 살고 있다.
내가 뭘 본 줄 아는 ‘그들’의 시선
현대의 대부분 서비스는 사용자를 직접 ‘기록’하지 않는다. 하지만, 사용자의 행동을 정교하게 ‘관찰’ 한다.
퍼스널라이징의 함정
추천 시스템은 나의 선택을 대신하고, 내가 뭘 좋아할지 미리 판단하고, 그 판단을 내 앞에 놓는다.
내가 만든 데이터가 나를 규정하는 순간
데이터는 과거의 나를 기억한다. 그리고 현재를 해석하고, 미래를 예측한다.
5장
엑셀과 친하지 않아도 감각은 생긴다
6장
데이터로 말하는 사람이 결국 이긴다
7장
AI가 분석해줬다는데, 믿어도 될까?
AI 분석 결과, 그건 진짜 ‘팩트’일까?
AI가 몇 초 만에 내놓은 답에는 원본과 계산과 해석이 한 덩어리로 섞여 있다. 어디까지가 사실인지 가르는 30초짜리 습관.
데이터 편향이 만든 AI의 착각
AI는 주어진 데이터 안에서만 세상을 본다. 그 데이터 밖에 있는 사람은 처음부터 보이지 않는다. 결과가 이상하면 모델보다 입력 데이터를 먼저 봐야 하는 이유.
예측모델과 점쟁이 사이의 미묘한 차이
‘이탈 확률 78%’는 미래를 본 결과가 아니다. 숫자가 붙었다는 것과 검증할 수 있다는 것은 다른 이야기다.
AI 시대의 인간 데이터 감각
분석을 만드는 일이 쉬워질수록, 그 결과를 판단하는 능력의 값이 올라간다. AI에게 답 대신 검증을 시키는 법.
8장
일상생활이 곧 데이터의 연속이다
운동앱, 칼로리 계산기, 수면 측정기 — 믿을 수 있을까?
수면 점수 62점을 보면 갑자기 피곤해진다. 측정과 추정과 해석은 다른 층인데, 앱은 셋을 한 줄로 보여준다.
연애도 데이터로 할 수 있을까?
키와 나이는 입력하기 쉽고, 같이 있을 때 마음이 편한지는 입력하기 어렵다. 그래서 조건 검색은 틀렸다기보다 불완전하다.
스마트폰 사용 패턴에서 보이는 진짜 나?
“나는 SNS를 별로 안 해.” 스크린타임은 하루 평균 2시간 17분이라고 말한다. 자책 대신 질문을 바꿀 차례다.
소비패턴 분석: 내가 사는 것인가, 소비되는 것인가?
“카페 지출 32% 증가.” 숫자는 맞지만 해석은 달라질 수 있다. 지출에는 감정과 시간과 생활 패턴이 숨어 있다.
9장
데이터로 트렌드를 읽는다는 착각
검색량이 많으면 트렌드일까?
300% 증가. 먼저 볼 것은 증가율이 아니라 원래 검색량이다. 100회가 400회가 된 것과 10만이 11만이 된 것은 다르다.
바이럴은 데이터일까 조작일까?
‘많이 보였다’와 ‘많이 선택됐다’는 같은 말이 아니다. 조회수 100만을 실제 영향력으로 번역하기 전에 노출·반응·행동·결과를 나눠 보는 법.
인플루언서의 수치, 진짜 영향력일까?
팔로워 50만 계정의 구매 70건, 3만 계정의 구매 280건. 영향력은 가장 큰 숫자가 아니라 우리 목적과 가장 관련 있는 숫자에서 찾아야 한다.
트렌드 분석 리포트가 놓치고 있는 것
리포트에 잡힐 정도면 이미 커진 뒤일 수 있다. 관심의 증가와 행동의 변화와 시장의 성장을 나누고, 대시보드 밖 현장의 목소리를 함께 읽는 법.
10장
내 돈을 지키는 데이터 감각
투자 수익률, 어디까지 믿을 수 있나?
“3년 수익률 60%.” 언제부터 언제까지인지, 무엇과 비교했는지, 그동안 얼마나 흔들렸는지. +50%와 -50%는 상쇄되지 않는다.
‘가장 많이 오른 주식’ 뒤에 숨겨진 진실
“10년 전에 샀다면 얼마?” 계산은 맞다. 다만 그 사이 사라진 기업은 데이터에 없다. 숫자가 정확해도 데이터셋은 편향될 수 있다.
신용점수, 대출 조건, 보험료… 이 모든 게 데이터다
신용점수는 사람의 점수가 아니고, 대출은 금리 하나로 비교할 수 없다. 월 3만 원은 전체 기간으로 다시 계산해야 크기가 보인다.
금융 문맹보다 더 위험한 ‘데이터 문맹’
“수익률 20%”도 “대출금리 3%대”도 사실일 수 있다. 사실인 숫자가 오해를 만드는 방식을 알아차리는, 기준·기간·비용과 위험·내 실제 금액의 네 가지 번역.
11장