본문 바로가기
AI

[Udemy] Artificial Intelligence (AI) - 4. Rainforcement Learning

by yonikim 2026. 8. 8.
728x90

4. Rainforcement Learning (RL)

1. 머신러닝의 3가지 유형

Machine Learning
   ├── Supervised Learning
   ├── Unsupervised Learning
   └── Reinforcement Learning

 

1. 지도 학습(Supervised Learning)

  • 특징: 정답이 있는 데이터로 학습
  • 예시:
    • 학습 데이터:
      - (이미지1, "고양이")
      - (이미지2, "개")
      - (이미지3, "고양이")
      ...
    • AI: "이 패턴이 있으면 고양이, 저 패턴이 있으면 개구나"
  • 활용: 분류, 예측

2. 비지도 학습(Unsupervised Learning)

  • 특징: 정답 없이 데이터의 구조를 스스로 발견 
  • 예시:
    • 학습 데이터:
      - 고객1: [나이 25, 구매액 10만원, 방문 2회]
      - 고객2: [나이 55, 구매액 100만원, 방문 20회]
      - 고객3: [나이 27, 구매액 12만원, 방문 3회]
      ...
    • AI: "비슷한 고객끼리 묶으면 3개 그룹이 생기네!"
         - 그룹A: 젊고 저가 구매
         - 그룹B: 중년 고가 구매
         - 그룹C: ...
  • 활용: 고객 세그먼테이션, 이상 탐지

3. 강화 학습(Reinforcement Learning)

  • 특징: 행동의 결과(보상)를 통해 학습
  • 예시:
    • 게임 AI:
      - 행동1: 왼쪽으로 이동 → 벽에 부딪힘 → 보상: -10
      - 행동2: 오른쪽으로 이동 → 아이템 획득 → 보상: +100
      - 행동3: 점프 → 적을 피함 → 보상: +50
    • AI 학습: "오른쪽 이동이 가장 좋은 선택이었구나!
               다음엔 비슷한 상황에서 오른쪽으로 가자"
  • 활용: 게임 AI, 자율주행, 광고 최적화

 

2. 강화 학습 vs 인간 학습

1. 인간 확습

  • 1단계: 시도
    • 아기가 일어서려고 시도
    • 넘어짐
  • 2단계: 피드백 (보상)
    • 고통 (부정적 보상: -10)
  • 3단계: 학습
    • "이 자세는 넘어지는구나"
    • 다음엔 다른 자세로 시도
  • 4단계 반복
    • 다양한 자세 시도
    • 걷기 성공! → 부모님 칭찬 + 이동 가능 (긍정적 보상: +100)
    • "이 자세가 좋구나!" → 행동 강화
  • 결과: 수백 번의 시행착오 끝에 걷기를 마스터

2. 강화 학습과의 대응 관계

  • 아기 = Agent
  • 환경 (바닥, 물건 등) = Environment
  • 행동 (걷기 시도) = Actopm
  • 결과 (성공/실패) = Reward
  • 학습 = Policy 업데이트

3. 핵심 원리 

  • 긍정적 결과 → 행동 강화
  • 부정적 결과 → 행동 억제
  • 목표: 장기적으로 누적 보상을 최대화하는 행동 전략을 찾기

3. 강화 학습의 장점

1. 라벨 데이터 불필요

  • 지도 학습의 문제
    • 고양이 vs 개 분류를 위해:
      - 고양이 사진 10,000장에 일일이 "고양이" 라벨 붙이기
      - 개 사진 10,000장에 일일이 "개" 라벨 붙이기
    • → 시간과 비용이 엄청남
  • 강화 학습의 장점
    • 게임 AI:
      - 라벨 필요 없음
      - "이겼다/졌다" (보상)만 알면 됨
    • AI가 스스로 수백만 번 플레이하며 학습

2. 혁신적 해결 방식 도출

  • 지도 학습: 기존 데이터 패턴 "모방"
  • 강화 학습: 완전히 새로운 전략 발견 가능 
  • 예: 
    • 인간이 생각하지 못한 게임 전략 
    • 최적화 문제에서 새로운 해법

3. 편향(Bias) 감소

  • 지도 학습
    • 사람이 만든 데이터로만 학습
    • 사람의 편견이 그대로 반영
    • 사람보다 나은 해결책을 찾기 어려움
  • 강화 학습
    • 제약 없이 탐험
    • 사람이 생각하지 못한 전략 발견 가능 
  • 실제 사례: AlphaGo
    • 바둑 프로들이 수천 년간 쌓은 정석:
      - "37수에는 이렇게 두는 것이 정석"
    • AlphaGo의 37수:
      - 정석을 무시한 전혀 새로운 수
      - 프로 기사들 충격
      - 나중에 분석 결과 최선의 수로 판명
    • → 강화 학습이 사람의 편견을 넘어선 사례

4. 실시간 학습 및 적응

  • 지도 학습
    • 1. 데이터 수집
    • 2. 모델 학습 (1주일)
    • 3. 배포
    • 4. 사용
    • 5. 환경 변화 → 다시 1번부터
  • 강화 학습
    • 학습과 실행이 동시에:
      - 사용하면서 계속 학습
      - 환경 변화에 즉시 적응
      - 재학습 불필요
  • 예시: 광고 최적화
    • A/B 테스트 (기존 방식):
      - 광고 A를 1주일 노출
      - 광고 B를 1주일 노출
      - 결과 비교 후 결정
      → 2주 소요, 그 사이 비효율적 광고 계속 노출

    • 강화 학습:
      - 두 광고를 동시에 노출
      - 실시간으로 효과 측정
      - 좋은 광고의 노출 비율을 점점 증가
      → 비효율 최소화

5. 편향(Bias) 감소

  • 지도 학습의 문제
    • 채용 AI 사례:
      - 과거 채용 데이터로 학습
      - 과거 데이터가 남성 위주
      - AI가 남성을 선호하는 편향 학습
  • 강화 학습 
    • 목표: "최고의 인재 채용"
    • 보상: "입사 후 성과"
    • AI가 스스로 발견:
      - 성별은 성과와 무관
      - 학력도 일정 수준 이상이면 무관
      - 실무 경험과 문제 해결 능력이 중요
    • → 편향 없는 판단

6. 복잡한 연속 의사결정 가능

  • 지도 학습의 한계
    • 단일 의사결정만 가능:
      - "이 고객이 이탈할까?" → Yes/No
      - "이 제품이 팔릴까?" → Yes/No
  • 강화 학습
    • 연속적 의사결정:
      - 자율주행: "가속, 브레이크, 핸들"을 매 순간 결정
      - 게임: 수백 수를 내다보고 최적의 한 수 선택
      - 주식 거래: 매수/매도/보유를 계속 결정

4. 주요 활용

1. 개인화 추천

  • 고객 행동, 선호, 맥락을 실시간 반영
  • 기존 추천 시스템 대비 동적 최적화 가능
  • 특징:
    • 실시간 학습
    • 추천 성과 기반 자동 개선
  • 활용:
    • e-commerce (상품 추천)
    • 콘텐츠 플랫폼

2. 광고 예산 최적화

  • 광고 입찰가(Bid) 및 채널 자동 최적화
  • 사용자 + 컨텍스트 기반 의사결정
  • 효과:
    • ROI 극대화
    • 실시간 광고 전략 조정

3. 광고 콘텐츠 최적화

  • A/B 테스트 한계 극복
    • A/B 테스트: 결과 확인까지 시간 필요
    • 강화 학습: 실시간 최적화
  • 효과:
    • 비효율 콘텐츠 노출 최소화
    • 빠른 성과 개선

4. 고객 생애 가치 최적화 (CLV)

  • 단기 클릭/매출이 아닌, 장기 고객 가치(Lifetime Value) 최적화
  • 전략:
    • 과도한 광고 노출 방지
    • 개인 맞춤 경험 제공

5. 가격/상품 반응 예측 (Inverse Reinforcement Learning)

  • 고객 행동을 분석해 "목표 함수" 추정
  • 파악 가능:
    • 가격 민감도
    • 브랜드 선호
    • 서비스 기대 수준
  • 활용: 
    • 가격 전략
    • 상품 설계
    • 마케팅 전략

 

5. 실전 적용 사례

1. 주요 기업 사례

  • Intel - 반도체 품질 관리
    • 웨이퍼 결함 자동 탐지
    • 글로벌 공장 간 인사이트 공유
    • 효과:
      • 90% 이상 정확도
      • 문제 해결 속도 향상
      • 품질 일관성 확보
  • Google (DeepMind) - 데이터센터 에너지 최적화
    • 냉각 시스템 제어 최적화
    • 효과:
      • 에너지 사용 최대 40% 절감
  • Decision Service - 광고 최적화
    • 광고 클릭률 개선 
    • 효과:
      • CTR 25~30% 증가
      • 매출 18% 증가
  • Trendyol - 이메일 마케팅
    • 개인화 메시지 추천
    • 효과:
      • CTR +30%
      • 응답률 +60%
      • 전환율 +130%
  • Optoro - 반품 관리
    • 교환 유도 전략 최적화
    • 효과:
      • 67% 고객이 환불 대신 교환 선택
      • 매출 손실 최소화
  • Electa - 에너지 관리
    • 온수 시스템 최적화
    • 효과:
      • 에너지 소비 20% 감소
  • Mercedes Benz - 자율주행
    •  Drive Pilot (Level 3)
    • 센서 데이터 기반 실시간 의사결정
    • 효과:
      • 고속 자율주행 구현 (95km/h)
  • Cambridge University - 의료 치료 최적화
    • 패혈증 치료 정책 개선
    • 효과:
      • 기존 치료보다 높은 정확도
      • 생존율 개선 가능성

2. 성공 요인 

  • 실시간 의사결정 필요
  • 환경이 동적으로 변화
  • 장기 최적화 필요
  • 정답 데이터 부족

3. 주요 효과 

  • 비용 절감 (20~40%)
  • 매출 증가 (10~60%+)
  • 생산성 향상
  • 자동화 수준 증가
728x90