DATA · CRAFT
데이터 다루기
읽는 법 말고 만지는 법 — 모으고, 씻고, 특징을 뽑는 일
14편
1장
데이터를 다룬다는 것
1.1 6분
데이터 사이언스란? AI 시대 필수 스킬 배우기
데이터 사이언스는 데이터를 모으고 정제해 쓸모 있는 패턴을 뽑아내는 일이다. 수집 → 전처리 → 분석·시각화 → 머신러닝 → 실무 적용의 다섯 단계로 움직인다.
1.2 6분
데이터 과학자의 5가지 원칙
데이터 과학은 단순한 알고리즘 개발을 넘어, 문제 해결을 위한 체계적인 접근이 필수적인 분야입니다.
1.3 5분
비즈니스와 데이터: 문제에서 해결까지
모든 비즈니스는 특정한 문제에서 출발한다. 소비자의 불편을 해소하거나, 기업의 효율성을 높이거나, 새로운 시장 기회를 찾는 것 등 다양한 형태로 문제는 존재한다.
2장
데이터 모으기
2.1 5분
데이터 수집의 중요성: AI 모델을 위한 첫걸음
AI 모델이 정확한 결과를 도출하려면, 신뢰할 수 있는 데이터를 충분히 확보하는 것이 필수적입니다.
2.2 5분
AI와 데이터 크롤링: 자동화된 정보 수집의 현재와 미래
인터넷에는 수많은 정보가 실시간으로 생성되고 있습니다. 기업, 연구자, 개발자들은 이러한 데이터를 분석하여 시장 흐름을 파악하거나 소비자 반응을 예측하는 데 활용합니다.
2.3 6분
대규모 데이터 처리: 빅데이터와 AI의 역할
현대 사회에서 우리는 상상할 수 없을 만큼 많은 데이터를 매일 생성하고 있습니다.
3장
전처리하기
3.1 5분
AI와 데이터 전처리: 깨끗한 데이터를 만드는 과정
데이터 전처리는 수집한 데이터를 분석하기 전에 정리하고 가공하는 과정입니다.
3.2 6분
머신러닝을 위한 데이터 정제와 피처 엔지니어링 방법
머신러닝 모델이 성공적으로 작동하려면 깨끗하고 체계적인 데이터를 사용하는 것이 필수적입니다.
3.3 16분
데이터 전처리 대표 방식 — 지저분한 주문 표 하나로 따라 하기
전처리는 데이터를 믿고 쓸 수 있게 만드는 일이다. 형식·범주·중복·결측·이상값·단위를 예시 표 하나로 차례대로 다듬어 본다.
3.4 15분
pandas와 polars — 데이터가 커지면 도구를 바꿔야 하는 이유
작고 익숙한 일은 pandas, 메모리가 버거운 크기는 polars. 같은 전처리를 둘로 써 보고, 2천만 행에서 시간과 메모리를 재 봤다.
4장
Feature Engineering
5장