03. V1~V4 매칭 방법 — 무엇이고 어떻게 적용되는가
키워드 → 의미 → 구조 → 적용 가능성으로 신호를 누적해 캐스케이드 매칭.
V1키워드 매칭 (Baseline)
"이 단어들이 같이 나오나?" — 빠른 후보 필터
matching_score = 0.414 × 핵심(단독) + 0.320 × 세트(co-occurrence) + 0.265 × 연관
· 프레임 텍스트에서 핵심 / 세트 / 연관 3계층 키워드 추출
· 가중치는 Logistic Regression 학습 (TARGET 4 × 32, LOOCV 4/4)
· 32 프레임 중 1위 = 후보 프레임. TARGET 4/4 정답
↓ V1 Top-K 후보를 다음 축으로 재정렬
V2의미 매칭 (semantic rerank)
"단어가 달라도 의미가 같은가?"
similarity = cosine(MDX summary embedding, frame.content embedding) · model = jhgan/ko-sroberta-multitask
· V1 Top-K 후보 안에서 의미 유사도로 재정렬
· 키워드는 다르지만 같은 주제를 다룰 때 잡아냄
↓
V3구조 매칭 (structure rerank)
"이 콘텐츠를 담을 수 있는 레이아웃인가?"
score = 0.40 × layout_compat + 0.35 × content_affinity + 0.25 × structure_intent
· content_affinity 12 enum (concept_definition / goal_axes / persona_benefit / ...)
· structure_intent 9 enum (binary_compare / multi_parallel / state_transition / ...)
· alternative_patterns — 대안 layout 관계 (cycle ↔ 3col-parallel 등)
↓
V4적용 가능성 판정 (template-fit-v1)
"실제로 쓸 수 있나? 어느 정도 수정해야 하나?"
multi-axis: anchor + cardinality + relation + slot + content - penalty
→ 라벨: use_as_is / light_edit / restructure / reject
· 점수 1위 ≠ 실사용 가능. 판정 라벨로 결정
· reject 면 기존 프레임에 없는 신규 콘텐츠 → 재구성 신호