정부가 '독자 인공지능(AI) 파운데이션 모델' 프로젝트로 확보한 29종의 AI 학습용 데이터 3544만 건을 무료 개방한다.
과학기술정보통신부와 한국지능정보사회진흥원(NIA)은 이번 프로젝트 5개 정예팀이 1차 단계평가 과정에서 구축한 데이터를 AI허브 누리집(aihub.or.kr)에 공개한다고 27일 밝혔다.

이번 개방 데이터는 정예팀이 각자의 개발 전략에 맞춰 기획해 지난해 데이터 구축·가공 예산 150억 원을 통해 확보한 데이터로 사전학습에 필요한 대규모 데이터셋부터 영상·음성 등 멀티모달, 안전성 확보를 위한 레드티밍 데이터 등으로 구성돼 있다.
토큰으로 환산하면 약 1조 5600억 토큰에 달하며 이론적으로 70~80B 수준의 대형AI모델 학습에 사용될 수 있는 규모다.
먼저, 네이버클라우드는 공개 영상 234만 건과 방송 영상 52만 건, 해당 영상클립 기반의 텍스트 1550만 건과 음성 질의응답 1200만 건을 함께 구축했다.
텍스트는 장면을 문장 단위로 기술한 캡션 등으로 구성되어 AI모델의 영상 이해능력 학습과 이미지 생성 모델 학습에 활용될 수 있다.
업스테이지는 1조 토큰 규모의 대규모 사전학습 데이터와 50만 건의 사후 학습 데이터를 구축했다.
사전학습 데이터셋은 대규모 AI모델을 새로학습(from scratch)하는 데 쓰일 수 있으며, 사후학습 데이터는 단순 질의 응답을 넘어 추론, 판단, 실행 등 AI에이전트 개발을 위해 활용될 수 있다.
에스케이텔레콤(SK telecom)은 수학·과학·법률 등 전문 도메인 영역의 고난도 다단계 추론데이터, 음성·이미지 등 사후학습용 데이터와 국내 법령과 한국 사회의 보편적 가치관을 반영한 한국형 레드티밍 데이터 약 1만 건을 구축했다.
AI모델의 실무 해결역량 강화와 안전성·신뢰성 향상 등에 활용될 수 있다.
엔씨에이아이(NC AI)는 제조 분야 기술문서, 민원 상담 음성 등 현장의 실제 데이터를 기반으로 긴 문맥 이해, 단계별 추론, 멀티턴 대화, 질의 응답, 멀티 모달리티 등 LLM 핵심 역량 데이터 7종을 구축했다.
사후학습 성능 고도화와 산업 현장에 필요한 텍스트-이미지-음성 통합학습에 활용될 수 있다.
엘지(LG) AI연구원은 한국 가정환경에 최적화된 피지컬AI 멀티모달 데이터셋을 구축했다.
국내 50개 실제 가정환경에서 50종 이상의 가사 활동을 촬영해 17만 개 이상의 영상 클립 등을 구축하고, 객체·분할·자세·맥락 정보 등을 다층 라벨링했으며 비전·VLM 학습, 연구·상용서비스 개발 등에 활용될 수 있다.
이번 데이터 개방을 위해 NIA·한국정보통신기술협회(TTA)는 1차 단계평가 완료 후 데이터 전체를 각 정예팀으로부터 제공받았고 이후 데이터 품질검증, 개인정보·유해성 검증, 라이선스 제약 데이터 제외 등 조치를 진행했다.
'독자 AI 파운데이션 모델' 사업 공고상 참여조건에 따라 데이터 구축·가공 예산을 통해 확보한 데이터 중 50% 이상 개방이 필요한 상황에서 네이버클라우드, 업스테이지, 에스케이텔레콤, 엔씨에이아이는 품질검증 등을 거친 데이터 전체를 개방하기로 했다.
엘지 AI연구원은 의무개방량인 50% 이상을 준수해 공개 대상 데이터를 통계적으로 선별·개방하기로 했다.
이번에 공개된 29종 AI학습용 데이터는 국내 기업, 연구자, 학생 등 대한민국 국민이라면 누구나 AI허브를 통해 무료로 다운로드 받아 활용할 수 있다.
김경만 과기정통부 인공지능정책실장은 "독자 AI 파운데이션 모델 프로젝트는 단순히 AI모델 개발을 넘어 개발과정에서 축적된 경험과 노하우를 통해 AI생태계 전반의 질적 성장에 기여한다는 점에서 큰 의미"라고 설명했다.
이어 "개방된 데이터는 정예팀의 AI학습 전략이 담긴 귀중한 자산인 만큼 AI생태계 성장과 자생력 강화를 이끄는 밑거름이 될 것"이라고 말했다.
문의: 과학기술정보통신부 인공지능데이터정책과(044-202-6565)
문의처 : 문화체육관광부 정책포털과
| 뉴스 |
|
|---|---|
| 멀티미디어 |
|
| 브리핑룸 |
|
| 정책자료 |
|
| 정부기관 SNS |
|
※ 브리핑룸 보도자료는 각 부·처·기관으로부터 연계로 자동유입되는 자료로 보도자료에 포함된 연락처로 문의
※ 전문자료와 전자책의 이용은 각 자료를 발간한 해당 부처로 문의
- 제37조(출처의 명시)
- ① 이 관에 따라 저작물을 이용하는 자는 그 출처를 명시하여야 한다. 다만, 제26조, 제29조부터 제32조까지,
제34조 및 제35조의2의 경우에는 그러하지 아니하다. <개정 2011. 12. 2.> - ② 출처의 명시는 저작물의 이용 상황에 따라 합리적이라고 인정되는 방법으로 하여야 하며, 저작자의 실명
또는 이명이 표시된 저작물인 경우에는 그 실명 또는 이명을 명시하여야 한다.
- 제138조(벌칙)
- 다음 각 호의 어느 하나에 해당하는 자는 500만원 이하의 벌금에 처한다. <개정 2011. 12. 2.>
- 1. 제35조제4항을 위반한 자
- 2. 제37조(제87조 및 제94조에 따라 준용되는 경우를 포함한다)를 위반하여 출처를 명시하지 아니한 자
- 3. 제58조제3항(제63조의2, 제88조 및 제96조에 따라 준용되는 경우를 포함한다)을 위반하여 저작재산권자의 표지를 하지 아니한 자
- 4. 제58조의2제2항(제63조의2, 제88조 및 제96조에 따라 준용되는 경우를 포함한다)을 위반하여 저작자에게 알리지 아니한 자
- 5. 제105조제1항에 따른 신고를 하지 아니하고 저작권대리중개업을 하거나, 제109조제2항에 따른 영업의 폐쇄명령을 받고 계속 그 영업을 한 자 [제목개정 2011. 12. 2.]
이전다음기사
정책브리핑 게시물 운영원칙에 따라 다음과 같은 게시물은 삭제 또는 계정이 차단 될 수 있습니다.
- 1. 타인의 메일주소, 전화번호, 주민등록번호 등의 개인정보 또는 해당 정보를 게재하는 경우
- 2. 확인되지 않은 내용으로 타인의 명예를 훼손시키는 경우
- 3. 공공질서 및 미풍양속에 위반되는 내용을 유포하거나 링크시키는 경우
- 4. 욕설 및 비속어의 사용 및 특정 인종, 성별, 지역 또는 특정한 정치적 견해를 비하하는 용어를 게시하는 경우
- 5. 불법복제, 바이러스, 해킹 등을 조장하는 내용인 경우
- 6. 영리를 목적으로 하는 광고 또는 특정 개인(단체)의 홍보성 글인 경우
- 7. 타인의 저작물(기사, 사진 등 링크)을 무단으로 게시하여 저작권 침해에 해당하는 글
- 8. 범죄와 관련있거나 범죄를 유도하는 행위 및 관련 내용을 게시한 경우
- 9. 공인이나 특정이슈와 관련된 당사자 및 당사자의 주변인, 지인 등을 가장 또는 사칭하여 글을 게시하는 경우
- 10. 해당 기사나 게시글의 내용과 관련없는 특정 의견, 주장, 정보 등을 게시하는 경우
- 11. 동일한 제목, 내용의 글 또는 일부분만 변경해서 글을 반복 게재하는 경우
- 12. 기타 관계법령에 위배된다고 판단되는 경우
- 13. 수사기관 등의 공식적인 요청이 있는 경우



