전체기사 최신뉴스 GAM
KYD 디데이
경제 과학기술

속보

더보기

서울과기대·테디썸, 라마3-70B 기반 한글 특화 LLM '블라썸' 세계최초 공개

기사입력 :

최종수정 :

※ 본문 글자 크기 조정

  • 더 작게
  • 작게
  • 보통
  • 크게
  • 더 크게

※ 번역할 언어 선택

라마3 70B 모델에 한국어 확장 첫 사례
업스테이지·솔트룩스·마음AI에 도전장
블라썸, 기본 모델 대비 89% 답변 향상

[세종=뉴스핌] 이경태 기자 = 국내 연구진과 인공지능(AI) 기업이 공동연구를 통해 메타의 오픈소스 거대언어모델(LLM)을 활용한 한국어 어휘 확장 대형 모델을 세계 최초로 개발했다. 

이미 오픈소스 기반 LLM 개발 업체인 업스테이지, 솔트룩스, 마음AI에 한발 앞선 기술력으로 도전장을 내민 셈이다.

서울과학기술대학교 다층퍼셉트론(MLP)연구실과 테디썸은 9일 오후께 한국어 최초 70B급 한국어-영어 초거대 언어모델 블라썸(Bllossom)을 완전 공개했다. 이는 현재 가장 좋은 성능으로 평가받는 공개 언어모델인 라마3(LLama3-70B) 기반 모델 중 어휘 확장 모델로는 전세계에서 최초로 꼽힌다.

메타는 지난달 18일(현지 시간) 자체 개발한 오픈소스 거대언어모델(LLM)인 라마(Llama)의 3세대 버전을 무료로 출시했다. 라마 3는 8B 및 70B 매개변수 두 모델로 우선 공개됐다. 라마3은 15조 개의 토큰으로 학습됐다. 

이 가운데 70B 모델은 오픈AI가 개발한 GPT-3.5보다 성능이 좋고 GPT4 성능에 근접한 수준이라는 평가를 일부 받는다. 라마3는 한국어에 특화돼 있는 모델로 평가된다.

테디썸이 라마3 70B 모델을 활용해 자체 개발한 한국어 특화 확장 거대언어모델인 '블라썸'을 허깅페이스에 9일 게재했다. 실제 전체 공개는 이날 오후께 진행된다. [사진=테디썸] 2024.05.09 biggerthanseoul@newspim.com

서울과기대와 테디썸은 라마3 70B모델에 추가적인 어휘확장을 했다.

어휘 확장은 특정 언어의 단어를 추가해 심층적인 표현이 가능하도록 하는 방법이다. 70B급 거대 언어모델은 어휘를 확장하면 새로운 어휘의 표현학습을 위해 엄청난 추가 학습시간 및 비용이 소요된다. 이렇다보니 70B급 모델에 어휘확장이 시도된 사례는 한국어에서는 아직 찾아볼 수 없다. 

이번 블라썸 모델은 서울과기대 슈퍼컴퓨팅센터의 컴퓨팅 지원을 토대로 대량의 GPU를 활용해 어휘확장 및 영어-한국어 지식 연결 학습이 가능했던 것으로 파악됐다.

임경태 서울과기대 인공지능응용학과 교수 연구팀은 이번 모델 개발을 위해 ▲한국어 표현력 강화를 위한 3만개가 넘는 한국어 어휘 추가 ▲한국어 어휘 표상 학습을 위한 대규모 사전학습 ▲한국어-영어 지식 연결을 위한 Parallel 학습 ▲한국어-영어 지식 표현을 위한 지시미세조정(Instruction Tuning) ▲사용자 피드백(feedback) 기반의 강화학습 등을 진행했다.

방대한 영어 지식을 한국어와 연결시키기 위해 직접 구축한 병렬(Parallel) 데이터 셋을 활용했다는 점과 언어학자들이 직접 구축한 정교한 지시미세조정 데이터가 성능을 크게 향상시켰다는 점이 이번 모델 개발에서 주목할 만한 요소다.

테디썸은 이번에 개발한 모델을 전체 공개해 개별적인 추가 학습과 상업적 이용이 가능하다는 점을 강조했다.

이번 모델은 한국어 토큰 확장으로 인해 25% 확장된 컨텍스트 활용이 가능하다. 인간평가와 GPT4 한국어 답변 선호도 평가 결과 GPT3.5와 유사하거나 약간 앞선 결과를 보인 바 있다. 라마3 70B 기본모델 대비 한국어 답변에 대해 89% 더 높은 답변 선호도 평가를 기록했다.

테디썸은 이미 8B 소형 모델은 전세계 기술 공유 플랫폼인 허깅페이스에 공개됐고 70B 거대모델도 이날 함께 공개했다. 개인 GPU에서 작동 가능한 4bit 양자화된 모델과 직접 활용해볼 수 있는 데모도 함께 내놓는다.

함영균 테디썸 대표는 "기존 빅테크에서만 연구개발하고 공개되지 않던 70B 거대 모델을 중소규모 회사 및 연구 그룹에서도 활용할 수 있도록 초거대 언어모델의 민주화에 기여했다는 점에서 의미있는 첫 발자국이라 생각한다"고 말했다.

한편 국내에서 라마3 소형 모델인 8B를 기반으로 자체 LLM 모델을 개발해 공개한 기업은 솔트룩스, 마음AI 등이다. AI 기업 데이터드리븐의 이준범 수석 AI 연구원도 개인적으로 8B 기반 모델을 공개한 바 있다.

biggerthanseoul@newspim.com

[뉴스핌 베스트 기사]

사진
"한국 유조선 7척 호르무즈에 갇혀" [서울=뉴스핌] 배정원 기자 = 중동 전쟁 여파로 국내 정유업계 원유 수송선 7척이 호르무즈 해협에 묶여 있는 것으로 파악됐다. 국회 외교통일위원회 여당 간사인 김영배 더불어민주당 의원은 5일 국회의원회관에서 열린 '중동 현황 및 대미 관세 협상 관련 현안 간담회'를 마치고 기자들을 만나 이같이 밝혔다. [서울=뉴스핌] 윤창빈 기자 = 한정애 더불어민주당 정책위의장이 5일 오전 서울 여의도 국회 의원회관에서 열린 중동 현안 관련 더불어민주당-재계 긴급 간담회에서 모두발언을 하고 있다. 2026.03.05 pangbin@newspim.com 김 의원은 "우리 기업 배 7척이 현재 호르무즈 해협에 묶여 있다고 한다"며 "1대가 큰 규모로 보면 200만 배럴 정도 싣고 있는데 이는 대한민국 전체 석유 하루 소비량이다. 그게 많게는 7척까지 묶여 있는 상황이라 대책이 필요하다는 기업들의 요구가 있었다"고 말했다. 구체적으로 "HD현대오일뱅크 배 2척, GS칼텍스 배 1척 등이 묶여 있는 상황"이라며 "회사 입장에서는 정부 비축분을 활용할 수 있는 방안이 있는지와 상황에 대해 계속 긴밀하게 협의했으면 좋겠다는 요청이 있었다"고 밝혔다. 김 의원은 "정부에서는 208일치 비축분이 있다고 하지만 이것이 아주 구체적인 현장의 요구와 맞물려 시나리오가 작성될 필요가 있다는 요구가 있었다"고 "또 가스, LNG의 경우에는 보관이 잘 안 되는 특성이 있기 때문에 다변화가 점검될 필요가 있다는 제안도 있었다"고 말했다. 이어 "현재는 가스 수요가 피크인 겨울이 지나 봄으로 들어가는 시기여서 국내적으로는 민간 수요 부분이 어느 정도 적어질 것으로 생각이 돼서 그나마 다행이다"고 덧붙였다.  jeongwon1026@newspim.com 2026-03-05 09:55
사진
미 잠수함, 이란 구축함 격침 [워싱턴=뉴스핌] 박정우 특파원 = 피트 헤그세스 미국 국방장관은 4일(현지시간) 미 해군 잠수함이 인도양 스리랑카 인근 해역에서 이란 해군 구축함을 어뢰로 격침했다고 밝혔다. 승조원 180명 가운데 수십 명이 실종된 것으로 알려으며, 스리랑카 당국은 현재까지 30여 명을 구조했다고 전했다. 헤그세스 장관은 이날 워싱턴 국방부 청사에서 연 브리핑에서 "미 해군 잠수함이 인도양에서 이란 해군 군함을 어뢰로 공격해 침몰시켰다"며 "이번 작전은 대(對)이란 군사 작전 확대의 일환"이라고 말했다. 그는 "이란 군함은 국제 수역에 있어 안전할 것이라 생각했겠지만, 대신 어뢰에 맞아 침몰했다"며 "2차 세계대전 이후 어뢰로 적함을 침몰시킨 첫 사례"라고 말했다. 헤그세스 장관은 이어 "미국은 결정적이고 파괴적이며 자비 없이 승리하고 있다"고 주장했다. 뉴욕타임스(NYT)는 스리랑카 정부가 침몰한 선박이 이란 해군 구축함 아이리스 데나호(IRIS Dena)라고 밝혔다고 보도했다. 비지타 헤라트 스리랑카 외무장관은 국회 보고에서 "아이리스 데나호는 스리랑카 영해 밖 남부 갈레(Galle) 인근 인도양 해역을 항해하던 중, 현지시간 오전 5시 8분 조난 신호를 보냈다"고 밝혔다. 헤라트 장관은 스리랑카 해군과 공군이 조난 신호를 접수한 뒤 함정과 항공기를 급파해 구조 작업을 벌였다고 했다. 그는 "중상을 입은 승조원 32명을 구조해 남부 해안 도시 갈레의 카라피티야 병원으로 이송했다"고 덧붙였다. 스리랑카 해군 대변인 부디카 삼파트 대위는 기자회견에서 "선체는 아직 보지 못했지만, 사고 해역에서 기름띠와 구명정을 확인했고, 주변 해역에서 떠다니는 시신도 발견됐다"고 말했다. 그는 "나머지 승조원들을 찾기 위한 해상·항공 수색 작업을 계속하고 있다"고 덧붙였다. 이번 사건은 스리랑카 영해 밖 공해상에서 발생했지만, 헤라트 장관은 "스리랑카는 국제 해상 수색 및 구조 협약의 서명국으로서 인도적 책임을 다하기 위해 개입했다"고 설명했다. 아이리스 데나호는 이란 해군이 운용하는 주요 구축함 가운데 하나로, 현지 매체와 스리랑카 당국은 이 군함에 약 180명의 승조원이 승선해 있었다고 전했다. 이 선박은 지난달 인도에서 열린 국제 해군 합동훈련에 참가했던 것으로 알려졌다. 미국과 이스라엘은 지난 주말 이란의 군사·안보 기구를 겨냥한 공습과 미사일 공격을 시작한 이후, 이란의 해군 거점과 함정들을 잇따라 공격하고 있다. 인도양 스리랑카 인근 공해상에서까지 이란 해군 구축함이 격침되면서, 전쟁이 이란 주변 해역을 넘어 원양으로 확전되는 양상이라는 평가가 나온다. 미국 국방장관 피트 헤그세스가 2026년 3월 2일(현지시간) 워싱턴 D.C. 펜타곤에서 미국·이스라엘의 대 이란 간 군사작전과 관련해 브리핑을 하고 있다. [사진=로이터 뉴스핌] dczoomin@newspim.com 2026-03-05 00:04
기사 번역
결과물 출력을 준비하고 있어요.
종목 추적기

S&P 500 기업 중 기사 내용이 영향을 줄 종목 추적

결과물 출력을 준비하고 있어요.

긍정 영향 종목

  • Lockheed Martin Corp. Industrials
    우크라이나 안보 지원 강화 기대감으로 방산 수요 증가 직접적. 미·러 긴장 완화 불확실성 속에서도 방위산업 매출 안정성 강화 예상됨.

부정 영향 종목

  • Caterpillar Inc. Industrials
    우크라이나 전쟁 장기화 시 건설 및 중장비 수요 불확실성 직접적. 글로벌 인프라 투자 지연으로 매출 성장 둔화 가능성 있음.
이 내용에 포함된 데이터와 의견은 뉴스핌 AI가 분석한 결과입니다. 정보 제공 목적으로만 작성되었으며, 특정 종목 매매를 권유하지 않습니다. 투자 판단 및 결과에 대한 책임은 투자자 본인에게 있습니다. 주식 투자는 원금 손실 가능성이 있으므로, 투자 전 충분한 조사와 전문가 상담을 권장합니다.
안다쇼핑
Top으로 이동