07. 키워드집 정리 과정 — 어떻게 1,713개로 정리되었나
Figma + BEPS + MDX 문장을 수집 → 형태소 분석 + 표기 통합 → 등장 범위별 분류 → 최종 1,713개 키워드 확정.
1수집 — 3 출처에서 문장 수집
| 출처 | 입력 문서 | 수집된 문장 |
|---|
| Figma 프레임 텍스트 | 32 개 | 586 |
| BEPS 마스터 텍스트 | 1 개 | 1,410 |
| MDX 검증 구간 | 4 개 | 129 |
| 합계 | 37 개 | 2,125 |
2전처리 — 형태소 분석 + 표기 통합
| 단계 | 전체 등장 수 | 고유 단어 수 |
|---|
| 형태소 분석 결과 (원시) | 13,913 | 1,738 |
| 전처리 후 (표기 통합 + 보존 규칙 적용) | 14,161 | 1,713 |
적용 규칙- 중요 표기 보존 :
DX, BIM, S/W, H/W, 2D, 3D, AS-IS, TO-BE 등 13개 — 깨지면 안 되는 표기 - 표기 통합 : "디지털 전환", "디지털전환" → 대표 표기
DX 로 합침 - 제외 : 1글자 단어, 순수 숫자, 공백/기호만 있는 토큰
- 품사 사용 : 일반명사 / 고유명사 / 외국어 표기 / 숫자 표기만 (조사·동사 등 제외)
3분류 — 등장 범위별 3 계층 (1,713 = 451 + 1,238 + 24)
| 계층 | 개수 | 등장 범위 | 의미 / 용도 |
|---|
| 핵심 키워드 | 451 | 1 프레임에만 | 특정 프레임에만 등장 → 식별력 강함. V1 매칭 가중치 0.414 |
| 연관 키워드 | 1,238 | 2~9 프레임 | 여러 프레임에 보조 등장 → 맥락 보강. V1 매칭 가중치 0.265 |
| 광범위 공통어 | 24 | 10+ 프레임 | 너무 흔해 식별력 낮음 → 매칭에서 가중 작음 |
| 합계 | 1,713 | — | 전체 고유 키워드 |
※ 위에 더해 키워드 세트 524개 별도 — 같은 프레임 내 함께 등장하는 키워드 묶음 (frame-level 시그니처). V1 매칭 가중치 0.320
결과 2,125 문장 → 형태소 분석 13,913 등장 (고유 1,738) → 전처리 후 최종 1,713 고유 키워드 + 524 키워드 세트.
키워드는 등장 범위로 3 계층 (451 / 1,238 / 24) — V1 매칭의 핵심·연관·광범위 신호로 사용.