전체기사 최신뉴스 GAM
KYD 디데이
문화·연예 문화·연예일반

속보

더보기

문체부·국립국어원 '챗GPT 말뭉치 사업' 긴급진단…현주소는?

기사입력 :

최종수정 :

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

문체부, 국어원과 'K-챗GPT' 저작권·활용방안 논의
국립국어원, K-GPT 개발 지원 '말뭉치' 사업
이달 말 '모두의 말뭉치' 영문판 홈페이지 개통
말뭉치 사업, 올바른 한국 정보 알리기 위한 기초 작업

[서울=뉴스핌] 이현경 기자 = 한국형 챗GPT 개발을 지원하는 국립국어원이 이달 말 '모두의 말뭉치' 홈페이지의 영문판을 개통한다.

'모두의 말뭉치'는 국립국어원이 거대 인공지능(AI) 기술에 활용될 언어 자료를 공식적으로 게시하는 온라인 공간이다. '모두의 말뭉치'의 영문판 홈페이지 구축은 한국 관련 정보의 오류 발생을 줄일 수 있는 발판을 마련한 것으로 해석된다. 

국어원에 따르면 '말뭉치 사업'은 고차원적인 한국어를 이해할 수 있는 자료인 동시에 저작권이 해결된 정보이기 때문에 기존 챗GPT가 소개하는 한국 정보보다 신뢰성도 높다. 이에 잘못된 한국 정보를 바로 잡는데 기여할 것으로 기대한다.  

[서울=뉴스핌] 이현경 기자 = 국립국어원의 '모두의 말뭉치' 홈페이지 2023.03.17 89hklee@newspim.com

유희정 국립국어원 언어정보과 학예연구사는 뉴스핌을 통해 "3월 말까지 '모두의 말뭉치' 영문 페이지를 개통하고,  올해 안으로 외국인 이용자의 홈페이지 회원가입 간소화를 위한 작업도 추진한다"고 밝혔다.

현재 '모두의 말뭉치' 홈페이지는 국문판만 개설돼 있다. 이곳에서도 국내외인 상관 없이 회원가입만 하면 국어원이 제공하는 한국어 말뭉치 자료를 내려받아 사용·활용할 수 있다. 가입 과정에서 휴대폰 번호를 통한 본인 인증이 필요한데, 외국인은 불가하기 때문에 그간 이메일이나 우편을 통한 서면 자료를 제출해야 하는 불편함이 있었다. 올해 내로 이 과정을 간소화해 외국인도 편리하게 한국어 말뭉치 자료를 활용할 수 있게 됐다.

장소원 국립국어원장은 말뭉치 사업이 한국에 대한 정확한 정보를 해외에 전하는데 도움이 될 것이라고 강조했다. 현재 공개된 챗GPT의 한국어 이해 능력과 한국에 대해 설명하는 정보는 신뢰할 수 없다는 평가다.

장 원장은 "한국어 챗GPT를 잘 만들려면 한국어 말뭉치를 잘 만들어야 한다"며 "챗GPT-4의 한국어 능력은 이전보다 나아졌지만, 앞선 세대는 잘못된 정보가 많았다. '국립국어원장이 누구냐'고 물으니 '김영권 교수'라며 거짓 정보를 말하더라"라고 말했다.

이어 "우리나라에 대한 정보를 잘 전달하기 위해서 말뭉치 사업이 필요하다"면서 "아직은 (오픈AI의)챗GPT 수준이 신뢰할 정도는 아니다. 잘 모르면 모르겠다고 하면 좋겠는데 지어내기도 한다"며 "미국에서 만든 챗GPT이기 때문에 한국어 말뭉치를 어디에서 가져온 것인지도 모른다. 국어원의 말뭉치 사업은 정교하고 고차원적인 해석이 가능하도록 하는 말뭉치 작업이기 때문에 한국어 능력과 정보에 대한 신뢰성을 올릴 수 있다. 또한 대기업, 작은 기업도 모두 활용할 수 있다"고 언급했다.

◆ 챗GPT 열풍… 문체부·국어원 K-GPT 개발 지원

[사진=게티이미지뱅크]

전 세계적으로 초거대 인공지능(AI)시대가 본격적으로 개막했다. 지난해 11월 미국의 인공지능 연구개발 기업 오픈AI가 개발한 챗GPT가 세상에 공개되면서다. AI의 인간을 뛰어넘는 학습 능력은 모두가 인정하는 부분이지만 자연스러운 언어 구사를 통한 소통은 신기술의 발전으로 평가된다.

챗GPT의 성능이 입증된지 불과 6개월도 채 되지 않은 지난 14일(현지시각)에는 인공지능 챗봇 '챗GPT'의 능력이 한 단계 더 향상됐다는 소식이 전해졌다. 오픈AI는 GPT-4를 공개하고 챗GPT가 문자뿐 아니라 사람의 손글씨, 이미지도 인식하고 이전보다 오류 발생률이 줄었다고 밝혔다. 앞서 11월에 공개된 GPT-3.5에 비해 GPT-4는 기존 회당 3000단어에서 2만5000단어를 처리할 정도로 수행력이 높아졌으며, 특히 한국어 처리 이해 정확도를 77%로 끌어 올리며 높은 성능을 자랑했다.

전 세계적인 챗GPT 열풍에 발맞춰 올해 2월 문체부는 국립국어원과 함께 추진하는 '한국어를 잘하는 K-챗GPT' 개발을 지원한다고 밝혔다. 이에 지난달 24일 AI 등 신기술 관련 저작권, 활용방안과 관련해 논의할 워킹그룹을 발족했다. 이 워킹그룹은 2027년까지 한국어 특성을 반영한 고품질 말뭉치 10억 어절 구축 계획을 세울 예정이다. 

올해는 한국형 챗GPT가 빠르게 개발될 수 있도록 25종, 약 1억2000만 어절의 고품질 한국어 말뭉치를 구축해 배포한다. 국어원에 따르면 4월 중 25종 말뭉치 사업과 관련한 발주를 마무리하고 5월 중 계약까지 체결한 후 수립된 올해 계획이 시행된다.

유희정 국어원 학예연구사는 "챗GPT-4가 올해 나온다는 건 지난해 말부터 예측이 됐다. 최근 챗GPT를 사용해보면 알겠지만 한국어로 소통이 가능하지만 한국에 대한 정보, 한국 문화와 한국어에 대한 이해는 뛰어나지 않다"고 평가했다.

◆ 국어원, '저작권' 문제 해결된 말뭉치 자료

국어원이 추진하는 말뭉치 사업은 AI가 '고차원적'인 한국어 처리 능력을 할 수 있도록 하는 밑바탕 작업이다. 국어원은 2018년부터 대규모 한국어 말뭉치 사업을 시작해 37종(약 22억 어절)을 공개 사이트인 '모두의 말뭉치' 통해 제공하며 한국어 인공지능 개발에 활용되고 있다.

고품질의 말뭉치는 사람이 직접 말뭉치에 한국어 분석 정보(어휘 의미, 구문, 개체명, 감성 등)를 입력하고 검수하는 과정을 거치는데, 이 과정에 비용이 많이 들기 때문에 한국어 말뭉치 제공은 스타트업의 언어자료 구축 비용 절감과 개발된 인공지능 기술의 고도화에 기여하고 있다.

국어원이 제공하는 '말뭉치'는 '저작권' 문제가 해결된 자료다. 여러 분야의 정보를 제공하는 AI의 학습을 위해 다양한 방면의 자료가 필요하다보니 자료 수집 과정에서 중복된 자료, 거짓 정보까지 포함된다. 여기에 출처가 분명하지 않으면 저작권 문제까지 번질 수 있다. 누구나 자료를 쓸 수 있게 하기 위해 저작권 문제에 집중하고 있으며 예산도 저작권 관련 비중이 가장 높다. 

유희정 연구사는 "실제로 웹크롤링(웹 검색을 통해 추출하는 자료)을 통한 공개된 데이터를 개발과 연구에 사용할 때 윤리적인 문제나 저작권 문제가 발생한다"고 말했다.

이어 "저작권을 확보한 자료를 수집하더라도 인공지능이 학습할 수 있는 형식으로 가공이 필요한데 이 작업을 국어원에서 한다"며 "인공지능 모델이 한국어를 처리하기 위해 이 자료를 어떤 뜻으로 해석해야 하고 어떤 문장으로 분석해야하는 지 등의 지침을 만들고 데이터화하는 작업까지 한다"라고 소개했다. 

유 연구사는 "카카오나 네이버와 같은 대기업은 AI 모델에 학습시킬 다양한 한국어 자료를 확보할 사정이 되지만 이에 비해 중소기업이나 스타트업은 거대 데이터 수집이 힘들고, 이 과정에서 자료가 중복되거나 사실이 아니거나 저작권이나 윤리적인 문제가 일어날 수 있다"며 "국어원이 제공하는 자료는 저작권과 관련해서는 안심하고 사용할 수 있다"고 덧붙였다. 

89hklee@newspim.com

[뉴스핌 베스트 기사]

사진
李대통령 국정지지율 61% [한국갤럽] [서울=뉴스핌] 박찬제 기자 = 이재명 대통령의 국정 지지율이 소폭 상승해 61%를 기록했다는 여론조사 결과가 23일 나왔다. 한국갤럽은 지난 20~22일 전국 만 18살 이상 유권자 총 1000명을 대상으로 진행한 조사에서 이 대통령의 직무수행 평가에 '잘하고 있다'며 답한 응답자는 지난주보다 3%포인트(p) 오른 61%로 나타났다. '잘못하고 있다'는 부정 평가는 직전 조사보다 2%p 줄어든 30%로 조사됐다. '의견 없음'은 10%다. 이재명 대통령이 21일 청와대에서 신년 기자회견을 하면서 언론 질문에 답하고 있다. [사진=청와대] 이 대통령 직무 수행의 긍정적 이유는 외교가 27%로 가장 높았다. 뒤이어 '경제·민생'이 14%, '소통'이 8%였다. 부정적 평가 이유로는 '경제·민생'이 22%, '독재·독단'과 '전반적으로 잘못한다'가 각각 7%를 차지했다. '도덕성문제·본인 재판 회피(6%)', '과도한 복지·민생지원금(5%)' 등의 이유도 있었다. 정당 지지도는 여당인 더불어민주당이 2%p 오른 43%, 국민의힘은 2%p 하락한 22%로 조사됐다. 조국혁신당은 3%, 개혁신당 2%, 진보당 1%였다. 무당층은 27%다.이번 조사는 이동통신 3사가 제공한 무선전화 가상번호를 무작위로 추출해 전화조사원이 인터뷰하는 방식으로 이뤄졌다. 표본오차는 95% 신뢰수준에서 ±3.1%포인트다. 응답률은 12.3%다. 자세한 내용은 중앙여론조사심의위원회 홈페이지에서 확인할 수 있다. pcjay@newspim.com 2026-01-23 10:51
사진
한덕수 징역 23년 선고...법정구속 [서울=뉴스핌] 홍석희 박민경 기자 = 윤석열 전 대통령의 내란 행위 방조 등 혐의로 재판에 넘겨진 한덕수 전 국무총리가 21일 1심에서 징역 23년을 선고받았다. 법원은 12·3 비상계엄을 "윤석열 전 대통령의 친위 쿠데타"로 규정하며 조은석 특별검사팀이 구형한 징역 15년을 훌쩍 뛰어넘는 중형을 선고했다. 서울중앙지법 형사합의33부(재판장 이진관)는 이날 내란우두머리방조·내란중요임무종사·위증 등 혐의를 받는 한 전 총리에게 징역 23년을 선고하고, 증거 인멸을 우려로 법정 구속했다. 검정색 정장, 흰색 셔츠에 청록색 넥타이를 매고 법정에 나온 한 전 총리는 재판부가 판결문을 읽는 동안 허리를 꼿꼿이 세우고 무표정으로 앉아 있었다. [서울=뉴스핌] 류기찬 기자 = 한덕수 전 국무총리가 21일 오후 서울 서초구 서울중앙지방법원에서 열린 내란 방조 및 내란 중요임무 종사 혐의 관련 1심 선고 공판에 출석하고 있다. 2026.01.21 ryuchan0925@newspim.com 재판부는 한 전 총리의 내란중요임무종사 혐의에 대해 유죄로 판단하면서 "12·3 비상계엄 선포와 이에 근거해 위헌·위법한 포고령을 발령하고, 군 병력을 동원해 국회 등을 점거한 행위는 형법상 내란 행위에 해당한다"고 판시했다. 재판부는 한 전 총리가 계엄 직전 국무회의의 절차적 요건을 갖추는 방식으로 내란의 중요한 임무를 종사했다고 봤다. 재판부는 "피고인은 윤석열에게 비상계엄에 대한 우려를 표했을 뿐, 반대한다고 말하지 않았다"며 "추가 소집한 국무위원들이 도착했음에도 윤석열에게 반대하거나, (국무위원들에게) 반대 의사를 표시하라고 말하지 않았다"고 했다. 재판부는 한 전 총리가 이상민 전 행정안전부 장관에게 특정 언론사 단전·단수를 이행하도록 함으로써 내란에 중요한 임무에 종사했다고도 판단했다. 또한 비상계엄 선포 및 포고령 발령과 관련해 한 전 총리에게 국헌 문란의 목적이 있다고 봤다. 재판부는 "피고인은 윤석열이 비상계엄을 하고 군 병력을 동원해 국회의 권능을 불가능하게 해 폭동을 일으킬 것을 충분히 예상할 수 있었다"고 지적했다. 재판부는 또한 사후 선포문과 관련해 허위공문서 작성 혐의, 대통령 기록물 관리법 위반, 공용서류 손상을 유죄로 판단했으며 허위공문서 행사 혐의에 대해서는 무죄로 봤다. 재판부는 양형과 관련해 설시하면서 윤 전 대통령의 비상계엄 선포에 대해 강도 높게 비판했다. 재판부는 "12·3 내란은 윤석열과 추종세력에 의한 위로부터의 내란 행위, 친위 쿠데타"라며 "위로부터의 내란은 위헌성 정도가 아래로부터의 내란과 비교할 수 없다"고 지적했다. 이어 "12·3 내란 과정에서 사망자가 발생하지 않았고 내란 행위는 4시간 만에 종료했으나 무장 군인에 맨몸으로 맞선 국민의 용기에 의한 것"이라며 "더불어 국민의 저항에 바탕해 국회에 진입해 계엄 해제 요구안을 (가결한) 일부 정치인의 노력과 위법에 저항하거나 소극적으로 참여한 일부 군경에 의한 것"이라고 부연했다. 재판부는 "피고인은 국무총리로서 헌법과 법률을 준수해야 할 의무가 있음에도 (내란이) 성공할지도 모른다는 사실에 이를 외면하고 일원으로서 가담했다"며 "2회 공판에서 내란 행위에 대한 법적 평가가 필요하다고 했다가, CCTV 재생 등으로 범죄사실이 탄로나자 마지 못해 최후진술에서 반성한다고 했지만 진정성을 보기 어렵다. 진지하게 반성했다고 볼 수 없다"고 했다. [서울=뉴스핌] 류기찬 기자 = 한덕수 전 국무총리가 21일 오후 서울 서초구 서울중앙지방법원에서 열린 내란 방조 및 내란 중요임무 종사 혐의 관련 1심 선고 공판에 출석하고 있다. 2026.01.21 ryuchan0925@newspim.com 재판부가 "피고인을 징역 23년에 처한다"고 주문을 읽자 한 전 총리는 별다른 표정 변화 없이 "재판장님 결정에 겸허하게 따르도록 하겠다"고 말했다. 이어 한 전 총리 측 변호인이 "도주 가능성이 없고 구속되면 항소심과 대법원의 재판 진행에 있어 방어권에 장애가 생긴다"고 했으나, 재판부는 "도주 우려가 있다"며 법정 구속했다. 이날 재판부가 12·3 비상계엄에 대해 "형법상 내란 행위에 해당한다"는 것을 뛰어넘어 "윤석열과 추종세력에 의한 친위 쿠데타"라고 규정하면서, 내란우두머리 혐의를 받는 윤 전 대통령의 유죄 가능성은 더욱 짙어졌다. 앞서 조은석 특별검사팀은 지난해 11월 26일 결심 공판에서 "피고인은 이 사건 내란 사태를 막을 수 있는 사실상 유일한 사람임에도 국민 전체의 봉사자로서 의무를 저버리고 계엄 선포 전후 일련의 행위를 통해 내란 범행에 가담했다"며 한 전 총리에게 징역 15년을 구형했다. 장우성 특별검사보는 선고 직후 기자들과 만나 "재판부의 판단에 경의를 표한다"며 "(항소 여부는) 특검과 회의해본 다음에 말씀드리겠다"고 밝혔다. 한 전 총리는 국정 2인자인 국무총리로서 대통령의 독단적 권한 행사를 견제해야 할 의무가 있음에도, 윤 전 대통령의 위헌·위법한 비상계엄 선포를 막지 않고 방조한 혐의 등을 받는다. 재판 진행 중에 재판부의 요청에 따라 내란중요임무종사 혐의도 추가됐다. 또한 계엄이 해제된 최초 계엄 선포문의 법률적 결함을 보완하기 위해 사후 선포문을 작성·폐기한 혐의와 헌법재판소의 윤 전 대통령 탄핵심판 변론에 증인으로 출석해 '계엄 선포문을 인지하지 못했다'는 취지로 위증한 혐의도 받는다. hong90@newspim.com 2026-01-21 15:51
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동