AI가 편향됐다는 말을 들으면 거대한 윤리 문제부터 떠올리기 쉽다. 하지만 편향은 우리의 평범한 데이터에서도 아주 쉽게 만들어진다.
온라인 쇼핑몰이 고객 리뷰를 AI로 분석했다고 해보자.
“고객의 82%가 배송에 만족합니다.”
좋은 결과처럼 보인다. 그런데 리뷰를 쓴 사람만 분석했다면 어떨까. 배송에 별 관심이 없는 고객은 애초에 리뷰를 쓰지 않았을 수 있고, 이벤트 포인트를 받으려고 긍정 리뷰를 남긴 고객이 많았을 수도 있다. 사람이 하는 설문에서도 똑같이 벌어지는 일이다 — 97%가 만족? 그 3%가 될 수 있는 나.
AI는 주어진 데이터 안에서 패턴을 찾는다.
데이터 밖에 있는 사람은 처음부터 보이지 않는다.
AI가 세상을 보는 창문은 데이터다
창문이 한쪽만 향해 있으면 아무리 시력이 좋아도 건물 반대편은 볼 수 없다. AI도 마찬가지다.
채용 데이터를 학습했는데 과거 특정 직군에 한 성별이 압도적으로 많았다면, AI는 과거의 그 패턴을 ‘성공적인 지원자의 특징’으로 받아들일 수 있다. 고객 이탈 분석도 온라인 행동 데이터만 풍부하고 오프라인 고객 정보가 부족하면, 온라인 고객을 중심으로 세상을 이해하게 된다.
여기서 중요한 질문은 “AI가 편향됐나?”보다 한 단계 앞에 있다.
이 AI가 보고 있는 데이터에는 누가 들어 있고, 누가 빠져 있는가? (원천데이터에 편향은 없는 것일까?)
편향은 수집 순간부터 시작된다
우리는 흔히 원본 데이터는 객관적이고 분석 단계에서만 편향이 생긴다고 생각한다. 하지만 데이터는 수집되는 순간부터 이미 선택된 것이다.
- 앱 사용 데이터에는 앱을 설치하지 않은 사람이 없다
- 고객 만족도 조사에는 응답하지 않은 사람이 없다
- SNS 반응에는 조용히 보고 지나간 사람의 감정이 남지 않는다
그래서 데이터가 크다고 해서 자동으로 대표성이 생기지는 않는다.
100만 건이 있어도 모두 비슷한 사람에게서 나온 것이라면, 잘 설계된 1,000명 표본보다 현실을 덜 보여줄 수 있다.
결과가 이상할 때는 모델보다 데이터를 먼저 보자
AI 분석 결과가 현실 감각과 다르면 사람들은 모델이나 프롬프트부터 바꾸려 한다. 하지만 먼저 확인해야 할 것은 입력 데이터다.
- 특정 집단의 데이터가 지나치게 많은가?
- 빠진 기간은 없는가?
- 성공 사례만 남아 있지는 않은가?
- 데이터가 수집된 환경이 지금과 같은가?
- 측정하기 쉬운 것만 기록한 것은 아닌가?
이 질문을 습관으로 만들면, AI의 답을 맹신하는 대신 데이터의 경계를 볼 수 있게 된다. AI 분석을 쉽게 해주는 것이지 데이터의 품질을 보장하지는 않는다. 품질을 잃는 순간 AI도 길을 잃게 된다.
AI는 세상을 직접 경험하지 않는다. 주어진 기록을 통해 세상을 추론할 뿐이다.
기록이 기울어져 있으면, 아무리 똑똑한 AI도 기울어진 세상을 배운다.
이 기울어짐이 애초에 어디서 생기는지는 데이터는 중립적이지 않다 에서 다뤘다. 기울어진 데이터를 실제로 어떻게 손보는지는 AI와 데이터 전처리 쪽 이야기다.