"""Phase 8 — Distinctive-Kiwi 키워드 전처리 강화 방식 검증 아이디어: - Kiwi 형태소 분석기로 명사·동사만 추출 - 32개 Figma 프레임 중 >50% 프레임에 등장하는 단어 = 공통어 → 제거 - 각 Figma의 "고유 키워드"만 남겨서 IDF 가중으로 MDX와 비교 - "요건" 같은 공통어가 제거되면 MDX03-1 문제가 풀릴까? 비교 대상: 1. Kiwi+BM25 (기존 baseline) 2. Distinctive-Kiwi 단독 (신규) 3. Distinctive-Kiwi → Cross rerank (신규 하이브리드) 4. BM25 → Cross rerank (Phase 7 winner) """ import sys import json from pathlib import Path sys.path.insert(0, str(Path(__file__).parent)) from common import load_figma_texts from extract_units import extract_units from methods import ( method_kiwi_bm25, method_cross_encoder, method_distinctive_kiwi, method_hybrid_distinctive_cross, method_hybrid_bm25_cross, ) ROOT = Path(r"d:\ad-hoc\kei\design_agent") PREVIEW_DIR = ROOT / "data" / "figma_previews" TARGET_UNITS = [ ("MDX01-2-details", "1. (MDX 1) 팝업 — DX와 BIM의 구분", "18"), ("MDX02-2.2-table", "2. (MDX 2) 2.2 DX 시행 주체별 기대효과", "14"), ("MDX03-1", "3. (MDX 03) 1. DX 시행을 위한 필수요건", "13"), ("MDX03-2", "4. (MDX 03) 2. Process 혁신과 Product 변화", "29"), ] def short_id(fid, frame_to_short): return frame_to_short.get(str(fid), "?") def main(): units = extract_units() figma = load_figma_texts() with open(PREVIEW_DIR / "index.json", encoding="utf-8") as f: idx_data = json.load(f) frame_to_short = {info["frame_id"]: sid for sid, info in idx_data.items()} # 전체 corpus에서 어떤 단어가 공통어인지 한 번 계산해서 공개 mdx_any = next(iter(units.values())) _, debug = method_distinctive_kiwi(mdx_any, figma, return_debug=True) general_words = debug["general_words"] print(f"[Phase 8] 공통어 ({len(general_words)}개, >50% Figma 등장): {general_words}") print() strategies = [ ("Kiwi+BM25 단독", method_kiwi_bm25), ("Distinctive-Kiwi 단독", method_distinctive_kiwi), ("Distinctive-Kiwi → Cross rerank", lambda m, f: method_hybrid_distinctive_cross(m, f, top_k=5)), ("BM25 → Cross rerank (Phase 7)", lambda m, f: method_hybrid_bm25_cross(m, f, top_k=5)), ] # 각 전략의 각 유닛 결과 print("=" * 70) print("전략 × 유닛 — 1순위 정답률") print("=" * 70) strategy_results = {} for sname, fn in strategies: top3_by = {} results = [] for uid, _, correct_id in TARGET_UNITS: text = units[uid] try: ranked = fn(text, figma) top3 = [short_id(fid, frame_to_short) for fid, _ in ranked[:3]] except Exception as e: top3 = ["ERR", "-", "-"] print(f"ERR {sname} {uid}: {e}") top3_by[uid] = top3 results.append(top3[0] == correct_id) marks = ["✓" if r else "✗" for r in results] score = sum(results) strategy_results[sname] = (results, top3_by) print(f" {sname:40s} {' '.join(marks)} = {score}/4") # MDX03-1 상세 — 왜 공통어 제거가 효과 있는지 보기 위해 print("\n" + "=" * 70) print("MDX03-1 (정답 13) 상세 — 공통어 제거 효과 검증") print("=" * 70) text = units["MDX03-1"] _, dbg = method_distinctive_kiwi(text, figma, return_debug=True) print(f"MDX03-1 원본 토큰들 중 공통어로 제거된 것: ", end="") mdx_tokens_raw = set() from methods import _extract_content_tokens, _get_kiwi kiwi = _get_kiwi() for t in _extract_content_tokens(text, kiwi): mdx_tokens_raw.add(t) removed = mdx_tokens_raw & set(dbg["general_words"]) print(sorted(removed)) print(f"MDX03-1 남은 고유 키워드: {dbg['mdx_distinctive']}") print(f"Frame 13 고유 키워드(상위): {list(set(dbg['figma_distinctive'].get('1171281190', [])))[:15]}") print(f"Frame 15 고유 키워드(상위): {list(set(dbg['figma_distinctive'].get('1171281192', [])))[:15]}") # MD 리포트 png_rel = "../../data/figma_previews/" lines = [] lines.append("# Phase 8 — Distinctive-Kiwi 키워드 전처리 강화") lines.append("") lines.append("**아이디어**: Kiwi 형태소 분석 + 32개 Figma 중 >50% 프레임에 등장하는 " "공통어 제거 + 각 Figma의 고유 키워드만 IDF 가중 매칭.") lines.append("") lines.append(f"### 전체 corpus에서 공통어로 제거된 단어 ({len(general_words)}개)") lines.append("") lines.append("> " + ", ".join(general_words)) lines.append("") lines.append("### 전략별 1순위 정답률") lines.append("") lines.append("| 전략 | MDX1 팝업(18) | MDX2 2.2(14) | MDX03-1(13) | MDX03-2(29) | 합계 |") lines.append("|------|---------------|--------------|-------------|-------------|------|") for sname, _ in strategies: results, top3_by = strategy_results[sname] marks = [] for idx, (uid, _, correct_id) in enumerate(TARGET_UNITS): t3 = top3_by[uid] mark = "✓" if results[idx] else f"✗({t3[0]})" marks.append(mark) score = sum(results) lines.append(f"| {sname} | {marks[0]} | {marks[1]} | {marks[2]} | {marks[3]} | **{score}/4** |") lines.append("") # 유닛별 Top-3 상세 (썸네일 포함) lines.append("---") lines.append("") lines.append("## 유닛별 전략 Top-3 상세") lines.append("") for uid, display, correct_id in TARGET_UNITS: lines.append(f"### {display} — 정답 Frame **{correct_id}**") lines.append("") lines.append("| 전략 | 1순위 | 2순위 | 3순위 |") lines.append("|------|-------|-------|-------|") for sname, _ in strategies: _, top3_by = strategy_results[sname] t3 = top3_by[uid] row = [sname] for sid in t3: info = idx_data.get(sid, {}) png = info.get("png", "") title = info.get("title_text", "").strip().replace("\n", " ") or "" if len(title) > 15: title = title[:15] + "…" mark = "⭐ " if sid == correct_id else "" cell = f"{mark}![{sid}]({png_rel}{png})
**{sid}**
{title}" row.append(cell) lines.append("| " + " | ".join(row) + " |") lines.append("") out_path = Path(__file__).parent / "MATRIX_PHASE8.md" out_path.write_text("\n".join(lines), encoding="utf-8") print(f"\n완료: {out_path}") if __name__ == "__main__": main()