전체기사 최신뉴스 GAM
KYD 디데이
산업 생활경제

속보

더보기

[김정호의 4차혁명 오딧세이] 아이에게서 배우는 AI 강화학습

기사입력 :

최종수정 :

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

우리는 어떻게 배우는가

필자가 처음 영어 공부를 시작한 것은 중학교 들어가기 전, 초등학교 6학년 때로 기억한다. 아마 공책에 a, b, c, d 알파벳을 필기체와 출판 서체로 연습한 기억이 난다. 그리고 영어로 배운 첫 문장이 “I am a boy,아니면 “You are a girl” 이 아닌가 생각한다.

        김정호 교수

본격적으로 영어를 공부한 시기는 고등학교 때이다. 그때 사용했던 영어 교재가 ‘성문종합영어’, ‘영어의 왕도’ , 그리고 ‘1200제’였다. 특히 그 중에 가장 어려운 교재가 ‘1200제”이었는데 아마도 일본 참고서를 번역한 책으로 기억한다.

그런데 이렇게 영어 공부를 시작할 때 재일 재미없었던 부분이 문법을 외우는 과정이었다. 명사, 대명사, 동사, 가정법 등 외우는 내용도 많고, 예외도 많았다. 그 규칙을 파악하고 외우고 이를 토대로 문장을 이해하고, 해석하고 작문하였다.

인공지능에서도 전통적으로 이와 비슷한 학습 방법을 써 왔다. 전통적 인공지능에서는 먼저 뇌와 지능의 동작 원리를 이해하고, 그에 맞추어 모델을 세우고 이를 컴퓨터 프로그램으로 구현하는 방법이다. 이 방법은 인간의 뇌의 동작을 인간의 논리로 파악하려 하는 방법이다. 영어 배울 때 문법으로 언어를 배우려는 시도와 같은 방법이다.

성문종합영어 참고서 내의 영어 문법과 작문 부분, [출처: tistory]


하지만 최근 딥뉴럴네트워크(DNN)으로 표현하는 인공지능은 빅데이터를 제공하고 그 데이터를 통해서 인공지능이 스스로 학습하는 방법이다. 이러한 방법을 ‘머신러닝' 인공지능이라고 한다. 여기서는 데이터를 믿고 학습한다. 이러한 머신러닝 학습 방법 중에서 인공지능 스스로 데이터를 만들어 내고 최적의 답을 만들어 내는 방법이 등장했는데, 이를 ‘강화학습(RL: Reinforcement Learning)’이라고 한다. 이를테면 컴퓨터 스스로가 자율학습을 해서 지능을 쌓아가는 방법이다.

아기가 처음 말을 배울 때 하는 말을 ‘옹알이’라고 한다. 옹알이를 통해서 엄마와 소통하면서 말을 배워나간다. 그때 처음 배우는 말이 ‘엄마’, ‘맘마’, ‘아빠’ 와 같은 단어들이다. 맘마라고 부르면 엄마가 우유를 주고, 엄마라고 부르면 엄마가 따뜻한 눈길을 주고 사랑으로 안아준다. 이처럼 아기가 언어를 배우는 과정에서는 아기가 주변 환경과 교류하면서 보상을 얻는 과정에서 말을 배운다. 우리처럼 문법을 통해서 배우지 않는다.

또한 아기가 걸음마를 배우는 과정도 비슷하다. 걷고, 넘어지고 다치면서, 시행착오를 거치면서 아장 아장 걷기를 배운다. 이때 환경은 거실 마루이고, 보상은 걷는 기쁨과 엄마의 웃음이다. 이처럼 주변환경 속에서 행동하고 보상 받으면서, 그 결과 최선의 결정과 행동을 하면서 학습하는 방법을 ‘강화학습’ 인공지능이라고 한다. 그래서 강화학습은 인간이 본능적으로 배우는 학습 방법이다.

아기가 옹알이를 하며 말을 배우고 있다. [출처: tistory]


시행착오 통한 강화학습, 로봇과 게임에도 적용 가능

강화학습에서는 주변 환경(Environment)이 있고 그 상태(State)를 벡터로 표현한다. 다양한 시도(Action)와 보상(Reward)를 얻으면서 스토리(Episode)를 만들고, 그 결과로 환경을 파악해 간다. 이렇게 시행착오를 거쳐서 학습하게 된다. 그리고 최적의 정책(Policy)을 찾아간다.

생쥐의 미로 찾기 게임이 강화학습의 좋은 한 예가 된다. 이 때 미로의 구조가 환경이 되고, 최종적으로 치즈를 먹게 되면 보상을 얻게 된다. 그렇지만 최단 시간 내에 찾아야 하는 조건이 붙게 된다. 이처럼 각 상태에 따라 미래를 정할 수 있고, 과거는 묻지 않는 조건을 강화학습에서는 마르코프(Markov) 조건이라고 한다. 강화학습을 적용하려면 마크코프 조건을 만족해야 한다. 과거는 묻지 않고, 현재 상태로만 그의 미래를 점치는 조건이다. 과거까지 따지면 너무 복잡해서 보상을 예측하기 어렵기 때문이다.

강화학습은 로봇의 걷기 제어에도 적용될 수 있다. 로봇이 넘어지고 걷기를 반복하면서 인간에게 가까운 최적의 보행 제어를 이러한 강화 학습 방법으로 찾을 수 있다. 마찬가지로 이러한 학습은 드론의 조종, 헬리콥터 조종, 항공기의 조종 제어에 사용할 수 있다. 더 나아가 자율주행 자동차의 자동 운전에 강화학습이 사용되어 주어진 조건(State) 에서 최적의 자율 운전을 할 수 있다. 이때 최종적으로 주어지는 보상이 연료비의 절약이나 사고율 저하, 안전성 향상 등이 될 수 있다.

이때 시행착오의 과정은 시간과 비용이 든다. 자동차를 부수기에는 비용이 비싸다. 경우에 따라 시행과 보상을 컴퓨터 시뮬레이션으로 대신 하기도 한다.

강화학습은 게임에 적용되기도 한다. 블록깨기(Atari Breakout)게임을 강화학습으로 하는 경우 금방 최적의 조건을 찾는 것을 볼 수 있었다. 돌이 블록 뒤로 들어가면 여러 번의 반사과정을 반복하면서 저절로 대부분의 블록이 격파되고 점수가 올라간다.

그래서 강화학습을 수행한 컴퓨터와의 인간과의 게임이 이제 더 이상 상대가 되지 않는다. 인공지능은 이런 경우뿐만 아니라 주식투자, 재고관리, 웹사이트의 광고 배치, 상품추천 등 다양한 분야에서 중요한 결정을 인간을 대신해서 할 수 있다. 인간처럼 이 때 보상은 경영상 이익이 된다. 컴퓨터는 졸거나, 피곤해 하거나, 술을 마시지도 불평하지도 않는다. 강화 학습으로 훈련한 보상 체계만 따를 뿐이다.

생쥐 미로게임에서 다양한 시도를 통해 치즈를 얻는 길을 찾는 인공지능 강화학습의 내부 구조, [출처: KAIST]
강화학습 인공지능으로 무장한 컴퓨터의 블록깨기(Atari Breakout) 게임, [출처:Ecosia]


강화학습은 인공지능의 '무기' 

이와 같이 강화학습은 데이터와 정답 없이 스스로 학습이 가능한 인공지능 알고리즘이다. 공부로 치면 자율학습 공부 방법이다. 인공지능이 데이터를 이용해서 학습하기 위해서는 데이터를 모으는 작업에서 많은 비용을 지불 해야 한다. 데이터 수거 장치, 전송 장치, 저장 장치에 투자해야 한다. 5G 무선 통신도 투자 비용이 크다. 그러면서도 데이터를 모으려면 개인의 허락을 받아야 하고, 개인 정보 보호 문제도 극복해야 한다. 그렇지만 강화학습은 데이터 없이 학습한다. 인공지능이 점점 강력해지는 또 다른 이유이기도 하다. 

 

joungho@kaist.ac.kr

[김정호 카이스트 전기 및 전자공학과 교수]

[뉴스핌 베스트 기사]

사진
"북한 핵잠수함은 순항핵잠(SSGN)" [서울=뉴스핌] 김종원 선임기자 = 북한 관영 조선중앙통신이 25일 김정은 북한 국무위원장이 8700t급 '핵동력 전략유도탄 잠수함 건조사업'을 현지 지도했다고 보도했다. 북한의 '핵동력 전략유도탄 잠수함'은 핵연료를 추진 동력으로 핵탄두를 장착한 잠수함발사 탄도미사일(SLBM)과 순항미사일(SLCM)을 운용할 수 있는 8700t급 중형 순항유도탄 핵잠(SSGN)으로 분석됐다. 북한은 올해 3월 핵동력 전략유도탄 잠수함 건조가 추진되고 있다고 공개했다. 당시 잠수함 하단부만 공개했지만 이번에는 동체 전체를 전격 공개했다. 건조 중인 핵잠 배수량이 8700t급이라고 처음 언급했다. 김정은 북한 국무위원장이 8700t급 핵잠수함 건조 현장을 지도했다고 북한 관영 매체들이 25일 보도했다. 사진은 방청도료가 칠해진 대형 선체를 살펴보는 김정은과 수행 간부들. [사진=노동신문]  ◆핵연료 장전·원자로 시운전·실출력 운전 남아 홍민 통일연구원 선임연구위원은 북한의 핵잠 건조 단계와 관련해 원자로 등 핵심 장비가 들어간 상태의 외피 결합과 외관 완성으로 평가했다. 홍 선임연구위원은 "핵추진잠수함 건조 단계로 볼 때 원자로 압력용기와 증기발생기, 주터빈 계통, 감속기·주축 라인, 주냉각 펌프 하우징, 미사일 발사관 구조물이 내부에 들어간 상태"라고 말했다. 홍 선임연구위원은 "잠수함 중앙부에 서 있는 김 위원장의 선체 중앙부는 원자로 구획 부분"이라면서 "최고지도자에게 공개했다는 것은 원자로 탑재가 끝난 완전한 선체 실루엣 상태라는 의미"라고 설명했다. 향후 핵연료 장전과 완전한 원자로 시운전, 실출력 운전이 남아 있는 것으로 분석했다. 8700t급과 중형 순항유도탄 핵잠(SSGN), 함교와 발사관 구간이 연동된 설계라고 봤다. 홍 선임연구위원은 "25개의 다축 트롤리에 얹혀 있는 잠수함 공개와 배수량 기준 미국·러시아·중국 등의 통상 1만1000~1만8000t급의 전략핵잠(SSBN)이나 순항핵잠(SSGN) 보다는 작은 사이즈"라면서 "배수량 기준으로는 러시아의 아쿨라급(8000~8500t), 델타급 III·IV(9000~10000t)과 유사하다"고 분석했다. 김정은 북한 국무위원장이 8700t급 핵잠수함 건조 현장을 살펴봤다고 노동신문이 25일 전했다. 사진은 딸 주애와 함께 이야기 하고 있는 모습. 뒤편의 '군자리 혁명 정신'이란 글귀는 6.25 전쟁 당시 탄약과 무기 제조와 보급을 위해 지하 군수공장이 위치한 군자리의 주민들이 결사의 각오로 임했다는 점을 강조하는 선동 구호. [사진=노동신문] ◆SLCM에 소수 SLBM 운용 혼합형 배치 특히 홍 선임연구위원은 "북한이 공개한 잠수함의 특징은 중앙 미사일 발사관 구획과 함교를 구분하지 않고 일체화시킨 설계"이라면서 "함교(지휘·항법·센서·통신 상부구조)와 발사관(VLS) 사이에 독립 격벽을 치고 외관상 매끄럽게 연동된 외형으로 처리했을 가능성이 있다"고 판단했다. 선체골격에서는 러시아 델타급 III·IV, 선체 비율에서는 중국의 진급(Type 094)과 유사한 것으로 분석했다. 중앙부가 두툼해지는 배럴형(bulged) 실루엣으로 발사관을 중앙에 집중 배치하는 델타급의 전형적 특징과 유사하다. 중앙 발사관 높이를 함교와 연동시킨 것은 SLCM 이외에도 소수의 SLBM을 운용하는 혼합형 배치 가능성도 있다고 홍 선임연구위원이 분석했다. 북한의 잠수함 용어 표현과 잠수함 성격으로 봤을 때 순항핵잠(SLCM)용이거나 SLCM 다수와 SLBM 소수의 혼합 플랫폼으로 봤다. 홍 선임연구위원은 "핵동력 전략유도탄 잠수함을 영문판에 'nuclear-powered strategic guided missile submarine'로 표기해 'guided missile'은 통상 순항미사일(SLCM)"이라고 설명했다. 북한 김정은(왼쪽 셋째) 국무위원장이 핵잠수함 건조 현장을 돌아봤다고 노동신문이 25일 전했다. 사진은 노동당 군수공업부장 조춘룡(김정은 오른쪽) 등과 잠수함 설비를 살펴보는 장면. 뒤편으로 '침략자 미제와 대한민국 것들을 쓸어버릴 무기생산에 총권기하자'는 선동 구호가 보인다. [사진=노동신문]  ◆한국 해군 핵잠수함 건조·도입 속도 붙을 듯 홍 선임연구위원은 "일단 핵탄두 SLCM을 탑재하는 SSGN의 성격이라고 볼 수 있다"면서 "다만 소수의 SLBM과 다수의 SLCM 혼합 플랫폼 가능성도 배제하기 어렵다"고 말했다. 핵탄두와 재래식탄두 이중 용도의 전략 순항미사일을 탑재하는 잠수함일 경우에는 저고도 비행으로 요격 회피 가능성이 있어 '제2격' 보복능력이 신장될 것으로 분석됐다. 홍 선임연구위원은 "8700t급 SSGN일 경우 전략순항 미사일 화살-2, 화살-1라-3(대형화 개량형), 불화살-3-3-1 등을 탑재할 수 있고 사거리는 1500~2000km 정도일 것으로 보인다"고 관측했다. 잠수함 함수 부분에 어뢰관 6~7개가 식별돼 핵어뢰 탑재 가능성도 나온다. 현재 미국은 공격핵잠(SSN) 50척과 순항핵잠(SSGN) 4척, 전략핵잠(SSBN) 14척 잠수함 전력으로 전 세계를 상대로 24시간 365일을 중단 없이 전략·전술 작전을 벌이고 있다. 북한이 핵잠 실물 전체를 전격 공개함에 따라 향후 한국의 핵잠 건조와 도입도 속도가 붙을 것으로 보인다. kjw8619@newspim.com 2025-12-25 14:17
사진
연말 공항은 설렘으로 가득하다 [서울=뉴스핌] 신수용 기자 = #. 스타트업 입사 4년 차인 30대 직장인 A씨는 연말에 아껴둔 휴가를 소진하기로 결심했다. 그동안 여러 프로젝트로 쓰지 못한 연차를 모두 사용하기로 했다. 회사에서도 연차 소진 권고가 내려지면서 징검다리 연휴를 눈치 보지 않고 사용할 수 있는 분위기가 조성됐다. 이에 A씨는 크리스마스 이브인 23일, 24일과 26일 연차를 내고 22일 저녁 일본에 도착해 여정을 시작하는 6박 7일 여행을 다녀오기로 마음먹었다. [서울=뉴스핌] 신수용 기자 = 24일 비행기 출발을 기다리는 이들로 설렘이 가득차 있던 김포공항에는 크리스마스 이브를 맞이해 화요일인 26일 징검다리 연휴에 연차를 낸 이들과, 고국으로 돌아가는 외국인 관광객 등이 공항에 자리했다. 2025.12.24 aaa22@newspim.com 24일 크리스마스를 앞둔 김포공항은 여행객으로 북적였다. 크리스마스 다음날인 26일 금요일 하루를 연차로 내면 최소 3박 4일의 휴가를 즐길 수 있어서다. 내년 1월 1일 신정까지 연차를 내면 최장 11일을 휴가로 사용할 수 있다. 커다란 캐리어를 양손에 쥐고 있는 하루토(가명·23) 씨는 이날 고국인 일본으로 돌아간다. 그는 "한국 여행을 마치고 가족들과 크리스마스와 연말을 함께 보내기 위해 고국인 일본에 가기로 했다"고 설명했다. 이날 출국장에는 외국인들이 화장품 등 다양한 선물을 가득 담은 박스와 커다란 캐리어를 밀며 분주히 오갔다. 출국장에 위치한 체크인 줄에는 커다란 기내용 캐리어를 쥔 사람들로 줄들이 가로세로 빽빽히 차 있었다. 이른 아침 시간에 출발하느라 챙기지 못한 끼니를 벤치에 앉아 간단히 빵과 커피로 때우는 이들도 간간히 보였다. 안양에서 왔다는 30대 커플은 "4박 5일 일정으로 대만으로 갈 예정"이라며 "직장인이라 업무 때문에 더 휴가를 내지 못해 아쉽다. 뒤에 휴가를 더 붙였다면 유럽에 가고싶었다"고 아쉬워했다. 이어 "업무가 쌓여있어도 연차를 아예 날릴 수는 없고 (회사에서도) 소진하라는 분위기여서 다행이었다"라며 "대만에서 맛있는 음식을 많이 먹어보고 싶다"며 기대감을 감추지 못했다. [서울=뉴스핌] 신수용 기자 = 24일 김포공항 출국장 한 켠에 쌓여 있는 캐리어와 수화물들. 2025.12.24 aaa22@newspim.com 이날 공항에서 만난 40대 여성은 서울 서초구 양재에서 공항으로 왔다. 그는 "중국 상하이에서 근무하는 남편을 만나러 간다"며 "중국에서 2주 정도 같이 연말을 보낼 것"이라고 말했다. 해외에서 보내는 장기 휴가가 가능한 이유는 크리스마스인 25일, 내년 신정인 1월 1일이 각각 목요일이기 때문이다. 금요일인 26일(금요일), 29일부터 31일까지, 내년 1월 2일(금요일) 등 총 5일의 연차를 사용하면 최장 11일의 휴가를 즐길 수 있다. 가족끼리 휴가일을 맞춰 같이 해외 휴가를 가는 경우도 있었다. 장승훈(28·건국대 컴퓨터공학과) 씨는 "참여하고 있는 개발자 관련 프로그램에 양해를 구하고 나를 포함해 총 6명이 중국 상하이로 어머니 생일과 가족 기념일을 겸해 가족 여행을 간다"며 "아버지나 삼촌 등 다른 분들도 휴가를 낼 수 있었던 것 같은데 중국을 가본 적이 없어 기대가 된다"고 말했다. 이날 출국하는 여행객들의 목적지는 일본과 중국이 대부분이었다. 고환율과 엔저의 영향으로 여행 경비 부담이 비교적 덜한 일본이나 중국이 인기 관광지로 꼽혔다. 여행 전문 기업 노랑풍선에 따르면 올해 12월 25일부터 내년 1월 4일까지 노랑풍선을 통해 해외 패키지여행을 예약한 고객 수는 전년 동기간 대비 약 10% 증가한 것으로 나타났다. 특히 이중 일본이 30%로 가장 높았고, 중국(20%)이 그 뒤를 이었다. 베트남과 필리핀은 각각 16%, 7%를 차지했다. 노랑풍선 관계자는 "한한령 완화와 단체 비자 발급 확대, 주요 노선의 항공편 증편 등 여행 여건이 개선되면서 중국 여행객이 늘었다"며 "긴 연휴로 장거리 여행을 가는 이들이 생기며 유럽은 8% 수준을 늘었다"고 설명했다. aaa22@newspim.com 2025-12-24 14:41
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동