연합뉴스

[AI픽] 독파모 5개팀 AI 학습데이터 푼다…1.56조 토큰 공개

입력 2026-08-27 14:00:04

다음 내용이 궁금하다면?

불편하시다면 뒤로 가기를 눌러주세요


29종·3천544만건 규모…AI허브서 기업·연구자 등에 무료 개방


사전학습부터 추론·멀티모달·레드티밍·피지컬 AI까지




독자 AI 파운데이션 모델 프로젝트 착수식

(서울=연합뉴스) 배경훈 과학기술정보통신부 장관이 9일 서울 중구 르메르디앙 미드센츄리룸에서 열린 '독자 AI 파운데이션 모델 프로젝트 착수식' 에서 참석자들과 기념 촬영하고 있다.
왼쪽부터 임우형 LG AI연구원장, 김유원 네이버클라우드 대표, 배경훈 과학기술정보통신부 장관, 이연수 NC AI 대표, 유영상 SK텔레콤 대표, 김성훈 업스테이지 대표. 2025.9.9 [과학기술정보통신부 제공. 재판매 및 DB 금지] photo@yna.co.kr


(서울=연합뉴스) 박형빈 기자 = 정부가 독자 인공지능(AI) 파운데이션 모델 프로젝트에 참여한 5개 정예팀이 개발 과정에서 확보한 대규모 AI 학습 데이터를 공개한다.


과학기술정보통신부와 한국지능정보사회진흥원(NIA)은 네이버클라우드, 업스테이지, SK텔레콤[017670], NC[036570] AI, LG AI연구원이 1차 단계평가 과정에서 구축한 29종의 데이터를 AI허브 누리집을 통해 공개한다고 27일 밝혔다.


공개 데이터는 약 3천544만건, 추정 1.56조 토큰 규모다. 이론적으로 700억∼800억개 파라미터 수준의 대형 AI 모델 학습에 활용할 수 있는 규모로, 대규모 사전학습 데이터부터 영상·음성 등 멀티모달 데이터, AI 안전성 확보를 위한 레드티밍 데이터까지 포함한다.


네이버클라우드는 공개 영상 234만건과 방송 영상 52만건, 영상 클립을 기반으로 한 텍스트 1천550만건과 음성 질의응답 1천200만건을 구축했다. 영상 장면을 문장 단위로 설명하는 캡션 등이 포함돼 AI의 영상 이해와 이미지 생성 모델 학습에 활용할 수 있다.


업스테이지는 1조 토큰 규모의 사전학습 데이터와 50만건의 사후학습 데이터를 마련했다. 사후학습 데이터에는 추론·판단·실행 등이 포함돼 AI 에이전트 개발에 활용할 수 있다.


SK텔레콤은 수학·과학·법률 등 전문 분야의 고난도 다단계 추론 데이터와 음성·이미지 기반 사후학습 데이터, 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만건을 구축했다.


NC AI는 제조 분야 기술문서와 민원 상담 음성 등 실제 산업 현장 데이터를 활용해 긴 문맥 이해, 단계별 추론, 멀티턴 대화, 질의응답, 멀티모달리티 등 AI 핵심 역량과 관련된 데이터 7종을 구축했다.


LG AI연구원은 국내 가정환경에 특화한 피지컬 AI용 멀티모달 데이터셋을 마련했다. 실제 50개 가정에서 50종 이상의 가사 활동을 촬영해 17만개 이상의 영상 클립을 만들고 객체·분할·자세·맥락 정보 등을 다층적으로 라벨링했다.


이번 공개를 위해 NIA와 한국정보통신기술협회(TTA)는 데이터 품질과 개인정보·유해성 여부 등을 검증하고 라이선스 제약이 있는 데이터는 제외했다.


사업 참여 조건에 따라 구축·가공 예산으로 확보한 데이터의 50% 이상을 공개해야 하지만 LG AI 연구원을 제외한 나머지 참여사들은 검증을 거친 데이터를 모두 공개하기로 했다.


공개 데이터는 AI허브의 '독자AI모델 데이터' 항목에서 국내 기업과 연구자, 학생 등 누구나 무료로 이용할 수 있다. 일부 데이터는 안전한 온라인 환경에서 활용할 수 있는 '안심존'을 통해 별도 신청해야 한다.


과기정통부는 2차 단계평가 과정에서 구축된 데이터에 대해서도 품질검증 등을 거쳐 개방할 예정이다.


binzz@yna.co.kr



인기상품 확인하고 계속 읽어보세요!

5

원치 않을 경우 뒤로가기를 눌러주세요.

연합뉴스 콘텐츠 더보기

해당 콘텐츠 제공사로 이동합니다.

많이 본 최근 기사

관심 많은 기사