- src: phase_z2 composition/mapper/pipeline/placement_planner/retry, ai_fallback(prompts/schema/validate), mdx_text_atoms 신규 - Front: PipelineTracePanel 신규, FramePanel/SlideCanvas/Home/designAgentApi 등 갱신 + 테스트 4종 추가 - templates/phase_z2: catalog(component_expansion_registry, node_slot_mapping 신규), frames, families, slide_base 갱신 - tests/matching: phase2~26 매칭 실험 스크립트·리포트·온톨로지 전체 (미커밋 진행분) - tests: b4_v4 evidence, task5~28.5 시리즈, regression(imp95 baseline) 등 신규 테스트 대량 추가 - docs/reference: MDX 구조 인벤토리, MDX→Frame 구조 계약 문서 - scripts: mdx 계약/parity/coverage/viewport 체크, gitea comment, run sync 유틸 - .gitignore: tmp*.json, chromedriver, .orchestrator, *.pkl, Front_test* 등 임시/스냅샷 제외 미완성 작업의 보존용 스냅샷 커밋 (2026-07-02) Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
167 lines
6.7 KiB
Python
167 lines
6.7 KiB
Python
"""Phase 8 — Distinctive-Kiwi 키워드 전처리 강화 방식 검증
|
|
아이디어:
|
|
- Kiwi 형태소 분석기로 명사·동사만 추출
|
|
- 32개 Figma 프레임 중 >50% 프레임에 등장하는 단어 = 공통어 → 제거
|
|
- 각 Figma의 "고유 키워드"만 남겨서 IDF 가중으로 MDX와 비교
|
|
- "요건" 같은 공통어가 제거되면 MDX03-1 문제가 풀릴까?
|
|
|
|
비교 대상:
|
|
1. Kiwi+BM25 (기존 baseline)
|
|
2. Distinctive-Kiwi 단독 (신규)
|
|
3. Distinctive-Kiwi → Cross rerank (신규 하이브리드)
|
|
4. BM25 → Cross rerank (Phase 7 winner)
|
|
"""
|
|
import sys
|
|
import json
|
|
from pathlib import Path
|
|
|
|
sys.path.insert(0, str(Path(__file__).parent))
|
|
|
|
from common import load_figma_texts
|
|
from extract_units import extract_units
|
|
from methods import (
|
|
method_kiwi_bm25, method_cross_encoder,
|
|
method_distinctive_kiwi, method_hybrid_distinctive_cross,
|
|
method_hybrid_bm25_cross,
|
|
)
|
|
|
|
ROOT = Path(r"d:\ad-hoc\kei\design_agent")
|
|
PREVIEW_DIR = ROOT / "data" / "figma_previews"
|
|
|
|
TARGET_UNITS = [
|
|
("MDX01-2-details", "1. (MDX 1) 팝업 — DX와 BIM의 구분", "18"),
|
|
("MDX02-2.2-table", "2. (MDX 2) 2.2 DX 시행 주체별 기대효과", "14"),
|
|
("MDX03-1", "3. (MDX 03) 1. DX 시행을 위한 필수요건", "13"),
|
|
("MDX03-2", "4. (MDX 03) 2. Process 혁신과 Product 변화", "29"),
|
|
]
|
|
|
|
|
|
def short_id(fid, frame_to_short):
|
|
return frame_to_short.get(str(fid), "?")
|
|
|
|
|
|
def main():
|
|
units = extract_units()
|
|
figma = load_figma_texts()
|
|
|
|
with open(PREVIEW_DIR / "index.json", encoding="utf-8") as f:
|
|
idx_data = json.load(f)
|
|
frame_to_short = {info["frame_id"]: sid for sid, info in idx_data.items()}
|
|
|
|
# 전체 corpus에서 어떤 단어가 공통어인지 한 번 계산해서 공개
|
|
mdx_any = next(iter(units.values()))
|
|
_, debug = method_distinctive_kiwi(mdx_any, figma, return_debug=True)
|
|
general_words = debug["general_words"]
|
|
print(f"[Phase 8] 공통어 ({len(general_words)}개, >50% Figma 등장): {general_words}")
|
|
print()
|
|
|
|
strategies = [
|
|
("Kiwi+BM25 단독", method_kiwi_bm25),
|
|
("Distinctive-Kiwi 단독", method_distinctive_kiwi),
|
|
("Distinctive-Kiwi → Cross rerank", lambda m, f: method_hybrid_distinctive_cross(m, f, top_k=5)),
|
|
("BM25 → Cross rerank (Phase 7)", lambda m, f: method_hybrid_bm25_cross(m, f, top_k=5)),
|
|
]
|
|
|
|
# 각 전략의 각 유닛 결과
|
|
print("=" * 70)
|
|
print("전략 × 유닛 — 1순위 정답률")
|
|
print("=" * 70)
|
|
strategy_results = {}
|
|
for sname, fn in strategies:
|
|
top3_by = {}
|
|
results = []
|
|
for uid, _, correct_id in TARGET_UNITS:
|
|
text = units[uid]
|
|
try:
|
|
ranked = fn(text, figma)
|
|
top3 = [short_id(fid, frame_to_short) for fid, _ in ranked[:3]]
|
|
except Exception as e:
|
|
top3 = ["ERR", "-", "-"]
|
|
print(f"ERR {sname} {uid}: {e}")
|
|
top3_by[uid] = top3
|
|
results.append(top3[0] == correct_id)
|
|
marks = ["✓" if r else "✗" for r in results]
|
|
score = sum(results)
|
|
strategy_results[sname] = (results, top3_by)
|
|
print(f" {sname:40s} {' '.join(marks)} = {score}/4")
|
|
|
|
# MDX03-1 상세 — 왜 공통어 제거가 효과 있는지 보기 위해
|
|
print("\n" + "=" * 70)
|
|
print("MDX03-1 (정답 13) 상세 — 공통어 제거 효과 검증")
|
|
print("=" * 70)
|
|
text = units["MDX03-1"]
|
|
_, dbg = method_distinctive_kiwi(text, figma, return_debug=True)
|
|
print(f"MDX03-1 원본 토큰들 중 공통어로 제거된 것: ", end="")
|
|
mdx_tokens_raw = set()
|
|
from methods import _extract_content_tokens, _get_kiwi
|
|
kiwi = _get_kiwi()
|
|
for t in _extract_content_tokens(text, kiwi):
|
|
mdx_tokens_raw.add(t)
|
|
removed = mdx_tokens_raw & set(dbg["general_words"])
|
|
print(sorted(removed))
|
|
print(f"MDX03-1 남은 고유 키워드: {dbg['mdx_distinctive']}")
|
|
print(f"Frame 13 고유 키워드(상위): {list(set(dbg['figma_distinctive'].get('1171281190', [])))[:15]}")
|
|
print(f"Frame 15 고유 키워드(상위): {list(set(dbg['figma_distinctive'].get('1171281192', [])))[:15]}")
|
|
|
|
# MD 리포트
|
|
png_rel = "../../data/figma_previews/"
|
|
lines = []
|
|
lines.append("# Phase 8 — Distinctive-Kiwi 키워드 전처리 강화")
|
|
lines.append("")
|
|
lines.append("**아이디어**: Kiwi 형태소 분석 + 32개 Figma 중 >50% 프레임에 등장하는 "
|
|
"공통어 제거 + 각 Figma의 고유 키워드만 IDF 가중 매칭.")
|
|
lines.append("")
|
|
lines.append(f"### 전체 corpus에서 공통어로 제거된 단어 ({len(general_words)}개)")
|
|
lines.append("")
|
|
lines.append("> " + ", ".join(general_words))
|
|
lines.append("")
|
|
|
|
lines.append("### 전략별 1순위 정답률")
|
|
lines.append("")
|
|
lines.append("| 전략 | MDX1 팝업(18) | MDX2 2.2(14) | MDX03-1(13) | MDX03-2(29) | 합계 |")
|
|
lines.append("|------|---------------|--------------|-------------|-------------|------|")
|
|
for sname, _ in strategies:
|
|
results, top3_by = strategy_results[sname]
|
|
marks = []
|
|
for idx, (uid, _, correct_id) in enumerate(TARGET_UNITS):
|
|
t3 = top3_by[uid]
|
|
mark = "✓" if results[idx] else f"✗({t3[0]})"
|
|
marks.append(mark)
|
|
score = sum(results)
|
|
lines.append(f"| {sname} | {marks[0]} | {marks[1]} | {marks[2]} | {marks[3]} | **{score}/4** |")
|
|
lines.append("")
|
|
|
|
# 유닛별 Top-3 상세 (썸네일 포함)
|
|
lines.append("---")
|
|
lines.append("")
|
|
lines.append("## 유닛별 전략 Top-3 상세")
|
|
lines.append("")
|
|
for uid, display, correct_id in TARGET_UNITS:
|
|
lines.append(f"### {display} — 정답 Frame **{correct_id}**")
|
|
lines.append("")
|
|
lines.append("| 전략 | 1순위 | 2순위 | 3순위 |")
|
|
lines.append("|------|-------|-------|-------|")
|
|
for sname, _ in strategies:
|
|
_, top3_by = strategy_results[sname]
|
|
t3 = top3_by[uid]
|
|
row = [sname]
|
|
for sid in t3:
|
|
info = idx_data.get(sid, {})
|
|
png = info.get("png", "")
|
|
title = info.get("title_text", "").strip().replace("\n", " ") or ""
|
|
if len(title) > 15:
|
|
title = title[:15] + "…"
|
|
mark = "⭐ " if sid == correct_id else ""
|
|
cell = f"{mark}<br>**{sid}**<br>{title}"
|
|
row.append(cell)
|
|
lines.append("| " + " | ".join(row) + " |")
|
|
lines.append("")
|
|
|
|
out_path = Path(__file__).parent / "MATRIX_PHASE8.md"
|
|
out_path.write_text("\n".join(lines), encoding="utf-8")
|
|
print(f"\n완료: {out_path}")
|
|
|
|
|
|
if __name__ == "__main__":
|
|
main()
|