728x90
4. Rainforcement Learning (RL)

1. 머신러닝의 3가지 유형
Machine Learning
├── Supervised Learning
├── Unsupervised Learning
└── Reinforcement Learning
1. 지도 학습(Supervised Learning)
- 특징: 정답이 있는 데이터로 학습
- 예시:
- 학습 데이터:
- (이미지1, "고양이")
- (이미지2, "개")
- (이미지3, "고양이")
... - AI: "이 패턴이 있으면 고양이, 저 패턴이 있으면 개구나"
- 학습 데이터:
- 활용: 분류, 예측
2. 비지도 학습(Unsupervised Learning)
- 특징: 정답 없이 데이터의 구조를 스스로 발견
- 예시:
- 학습 데이터:
- 고객1: [나이 25, 구매액 10만원, 방문 2회]
- 고객2: [나이 55, 구매액 100만원, 방문 20회]
- 고객3: [나이 27, 구매액 12만원, 방문 3회]
... - AI: "비슷한 고객끼리 묶으면 3개 그룹이 생기네!"
- 그룹A: 젊고 저가 구매
- 그룹B: 중년 고가 구매
- 그룹C: ...
- 학습 데이터:
- 활용: 고객 세그먼테이션, 이상 탐지
3. 강화 학습(Reinforcement Learning)
- 특징: 행동의 결과(보상)를 통해 학습
- 예시:
- 게임 AI:
- 행동1: 왼쪽으로 이동 → 벽에 부딪힘 → 보상: -10
- 행동2: 오른쪽으로 이동 → 아이템 획득 → 보상: +100
- 행동3: 점프 → 적을 피함 → 보상: +50 - AI 학습: "오른쪽 이동이 가장 좋은 선택이었구나!
다음엔 비슷한 상황에서 오른쪽으로 가자"
- 게임 AI:
- 활용: 게임 AI, 자율주행, 광고 최적화
2. 강화 학습 vs 인간 학습
1. 인간 확습
- 1단계: 시도
- 아기가 일어서려고 시도
- 넘어짐
- 2단계: 피드백 (보상)
- 고통 (부정적 보상: -10)
- 3단계: 학습
- "이 자세는 넘어지는구나"
- 다음엔 다른 자세로 시도
- 4단계 반복
- 다양한 자세 시도
- 걷기 성공! → 부모님 칭찬 + 이동 가능 (긍정적 보상: +100)
- "이 자세가 좋구나!" → 행동 강화
- 결과: 수백 번의 시행착오 끝에 걷기를 마스터
2. 강화 학습과의 대응 관계
- 아기 = Agent
- 환경 (바닥, 물건 등) = Environment
- 행동 (걷기 시도) = Actopm
- 결과 (성공/실패) = Reward
- 학습 = Policy 업데이트
3. 핵심 원리
- 긍정적 결과 → 행동 강화
- 부정적 결과 → 행동 억제
- 목표: 장기적으로 누적 보상을 최대화하는 행동 전략을 찾기
3. 강화 학습의 장점
1. 라벨 데이터 불필요
- 지도 학습의 문제
- 고양이 vs 개 분류를 위해:
- 고양이 사진 10,000장에 일일이 "고양이" 라벨 붙이기
- 개 사진 10,000장에 일일이 "개" 라벨 붙이기 - → 시간과 비용이 엄청남
- 고양이 vs 개 분류를 위해:
- 강화 학습의 장점
- 게임 AI:
- 라벨 필요 없음
- "이겼다/졌다" (보상)만 알면 됨 - AI가 스스로 수백만 번 플레이하며 학습
- 게임 AI:
2. 혁신적 해결 방식 도출
- 지도 학습: 기존 데이터 패턴 "모방"
- 강화 학습: 완전히 새로운 전략 발견 가능
- 예:
- 인간이 생각하지 못한 게임 전략
- 최적화 문제에서 새로운 해법
3. 편향(Bias) 감소
- 지도 학습
- 사람이 만든 데이터로만 학습
- 사람의 편견이 그대로 반영
- 사람보다 나은 해결책을 찾기 어려움
- 강화 학습
- 제약 없이 탐험
- 사람이 생각하지 못한 전략 발견 가능
- 실제 사례: AlphaGo
- 바둑 프로들이 수천 년간 쌓은 정석:
- "37수에는 이렇게 두는 것이 정석" - AlphaGo의 37수:
- 정석을 무시한 전혀 새로운 수
- 프로 기사들 충격
- 나중에 분석 결과 최선의 수로 판명 - → 강화 학습이 사람의 편견을 넘어선 사례
- 바둑 프로들이 수천 년간 쌓은 정석:
4. 실시간 학습 및 적응
- 지도 학습
- 1. 데이터 수집
- 2. 모델 학습 (1주일)
- 3. 배포
- 4. 사용
- 5. 환경 변화 → 다시 1번부터
- 강화 학습
- 학습과 실행이 동시에:
- 사용하면서 계속 학습
- 환경 변화에 즉시 적응
- 재학습 불필요
- 학습과 실행이 동시에:
- 예시: 광고 최적화
- A/B 테스트 (기존 방식):
- 광고 A를 1주일 노출
- 광고 B를 1주일 노출
- 결과 비교 후 결정
→ 2주 소요, 그 사이 비효율적 광고 계속 노출 - 강화 학습:
- 두 광고를 동시에 노출
- 실시간으로 효과 측정
- 좋은 광고의 노출 비율을 점점 증가
→ 비효율 최소화
- A/B 테스트 (기존 방식):
5. 편향(Bias) 감소
- 지도 학습의 문제
- 채용 AI 사례:
- 과거 채용 데이터로 학습
- 과거 데이터가 남성 위주
- AI가 남성을 선호하는 편향 학습
- 채용 AI 사례:
- 강화 학습
- 목표: "최고의 인재 채용"
- 보상: "입사 후 성과"
- AI가 스스로 발견:
- 성별은 성과와 무관
- 학력도 일정 수준 이상이면 무관
- 실무 경험과 문제 해결 능력이 중요 - → 편향 없는 판단
6. 복잡한 연속 의사결정 가능
- 지도 학습의 한계
- 단일 의사결정만 가능:
- "이 고객이 이탈할까?" → Yes/No
- "이 제품이 팔릴까?" → Yes/No
- 단일 의사결정만 가능:
- 강화 학습
- 연속적 의사결정:
- 자율주행: "가속, 브레이크, 핸들"을 매 순간 결정
- 게임: 수백 수를 내다보고 최적의 한 수 선택
- 주식 거래: 매수/매도/보유를 계속 결정
- 연속적 의사결정:
4. 주요 활용
1. 개인화 추천
- 고객 행동, 선호, 맥락을 실시간 반영
- 기존 추천 시스템 대비 동적 최적화 가능
- 특징:
- 실시간 학습
- 추천 성과 기반 자동 개선
- 활용:
- e-commerce (상품 추천)
- 콘텐츠 플랫폼
2. 광고 예산 최적화
- 광고 입찰가(Bid) 및 채널 자동 최적화
- 사용자 + 컨텍스트 기반 의사결정
- 효과:
- ROI 극대화
- 실시간 광고 전략 조정
3. 광고 콘텐츠 최적화
- A/B 테스트 한계 극복
- A/B 테스트: 결과 확인까지 시간 필요
- 강화 학습: 실시간 최적화
- 효과:
- 비효율 콘텐츠 노출 최소화
- 빠른 성과 개선
4. 고객 생애 가치 최적화 (CLV)
- 단기 클릭/매출이 아닌, 장기 고객 가치(Lifetime Value) 최적화
- 전략:
- 과도한 광고 노출 방지
- 개인 맞춤 경험 제공
5. 가격/상품 반응 예측 (Inverse Reinforcement Learning)
- 고객 행동을 분석해 "목표 함수" 추정
- 파악 가능:
- 가격 민감도
- 브랜드 선호
- 서비스 기대 수준
- 활용:
- 가격 전략
- 상품 설계
- 마케팅 전략
5. 실전 적용 사례
1. 주요 기업 사례
- Intel - 반도체 품질 관리
- 웨이퍼 결함 자동 탐지
- 글로벌 공장 간 인사이트 공유
- 효과:
- 90% 이상 정확도
- 문제 해결 속도 향상
- 품질 일관성 확보
- Google (DeepMind) - 데이터센터 에너지 최적화
- 냉각 시스템 제어 최적화
- 효과:
- 에너지 사용 최대 40% 절감
- Decision Service - 광고 최적화
- 광고 클릭률 개선
- 효과:
- CTR 25~30% 증가
- 매출 18% 증가
- Trendyol - 이메일 마케팅
- 개인화 메시지 추천
- 효과:
- CTR +30%
- 응답률 +60%
- 전환율 +130%
- Optoro - 반품 관리
- 교환 유도 전략 최적화
- 효과:
- 67% 고객이 환불 대신 교환 선택
- 매출 손실 최소화
- Electa - 에너지 관리
- 온수 시스템 최적화
- 효과:
- 에너지 소비 20% 감소
- Mercedes Benz - 자율주행
- Drive Pilot (Level 3)
- 센서 데이터 기반 실시간 의사결정
- 효과:
- 고속 자율주행 구현 (95km/h)
- Cambridge University - 의료 치료 최적화
- 패혈증 치료 정책 개선
- 효과:
- 기존 치료보다 높은 정확도
- 생존율 개선 가능성
2. 성공 요인
- 실시간 의사결정 필요
- 환경이 동적으로 변화
- 장기 최적화 필요
- 정답 데이터 부족
3. 주요 효과
- 비용 절감 (20~40%)
- 매출 증가 (10~60%+)
- 생산성 향상
- 자동화 수준 증가
728x90
'AI' 카테고리의 다른 글
| [Udemy] Artificial Intelligence (AI) - 6. Machine Learning (1) | 2026.08.10 |
|---|---|
| [Udemy] Artificial Intelligence (AI) - 5. RPA (0) | 2026.08.09 |
| [Udemy] Artificial Intelligence (AI) - 3. Deep Learning (0) | 2026.08.07 |
| [Udemy] Artificial Intelligence (AI) - 2. Computer Vision (0) | 2026.08.06 |
| [Udemy] Artificial Intelligence (AI) - 1. Generative AI (0) | 2026.08.05 |