GitHub 저장소 URL
https://huggingface.co/datasets/AIWORKX/KoSGD
분류 (모듈)
data-storage (데이터 & 저장소)
카테고리
datasets-tools (학습 데이터셋 및 관련 도구)
설명 (선택)
Google Schema-Guided Dialogue를 한국어로 번역하고 전수 휴먼 검수한 목적 지향 대화(ToD) 데이터셋으로, 21개 서비스 도메인 84,594턴 규모입니다. test 분할만 제공되며 의도 분류, 액션 및 슬롯 값 추출 등 한국어 LLM의 제로샷 대화 이해 평가에 쓰입니다.
체크리스트
추가 컨텍스트 (검토용)
- 기업/기관: 에이아이웍스 (NIPA 국내 기업 AI 오픈소스 목록, 엑셀 88행)
- Hub: HuggingFace dataset
- Likes: 6
- Downloads (30일): 47
- License: CC-BY-SA-4.0
- Pipeline: N/A
- Last Modified: 2025-12-31
- koreanSupport: true (데이터셋 카드 language: ko, 한국어 ToD 데이터셋이며 카드 본문 한국어)
- 제안 태그: korean, task-oriented-dialogue, schema-guided, dialogue-state-tracking, benchmark
Star 기준(1,000개)과 무관하게 국내 프로젝트 목록 등재를 위해 등록하는 이슈입니다. HuggingFace URL 항목은 HF 지원 PR이 머지된 뒤에 /approve 해야 합니다.
분류 근거
- 엑셀 분류: 데이터 & 저장소 > 학습 데이터셋 및 관련 도구 → 검토 결과 적절
- Google SGD를 한국어로 번역하고 전수 검수한 목적 지향 대화 데이터셋이므로 학습 데이터셋 카테고리가 맞습니다. 다만 test 분할만 제공되는 평가용 데이터셋입니다.
GitHub 저장소 URL
https://huggingface.co/datasets/AIWORKX/KoSGD
분류 (모듈)
data-storage (데이터 & 저장소)
카테고리
datasets-tools (학습 데이터셋 및 관련 도구)
설명 (선택)
Google Schema-Guided Dialogue를 한국어로 번역하고 전수 휴먼 검수한 목적 지향 대화(ToD) 데이터셋으로, 21개 서비스 도메인 84,594턴 규모입니다. test 분할만 제공되며 의도 분류, 액션 및 슬롯 값 추출 등 한국어 LLM의 제로샷 대화 이해 평가에 쓰입니다.
체크리스트
추가 컨텍스트 (검토용)
분류 근거