본문으로 바로가기

국내외 과학기술 정책에 대한 간략한 정보

단신동향

국내단신

독자 AI 파운데이션 모델 학습 데이터 29종·약 1.56조 토큰, 'AI허브'에 개방 원문보기 1

  • 국가 한국
  • 생성기관 과학기술정보통신부
  • 주제분류 핵심R&D분야
  • 원문발표일 2026-08-27
  • 등록일 2026-09-10
  • 권호 318
○ 과기정통부와 한국지능정보사회진흥원(NIA)이 독자 AI 파운데이션 모델 5개 정예팀의 1차 단계평가 과정에서 구축된 29종, 약 3,544만 건(약 1.56조 토큰 규모)의 AI 학습 데이터를 'AI허브'에 개방
- 해당 데이터는 사전학습용 대규모 데이터셋부터 영상·음성 기반 멀티모달 데이터, 안전성 확보를 위한 레드티밍 데이터까지 폭넓게 구성돼 약 70~80B급 대형 AI 모델 학습에 활용 가능한 규모
- 네이버클라우드·업스테이지·SK텔레콤·엔씨에이아이·LG AI연구원이 구축한 데이터는 품질·개인정보·유해성 검증을 마쳤으며, 국민 누구나 무료로 내려받아 활용 가능
- 향후 2차 단계평가 과정에서 구축되는 데이터도 품질검증을 거쳐 추가 개방해 AI 생태계의 질적 성장과 자생력 강화를 뒷받침할 계획

배너존

  • 케이투베이스
  • ITFIND
  • 한국연구개발서비스협회
  • 한국과학기술정보연구원