- src: phase_z2 composition/mapper/pipeline/placement_planner/retry, ai_fallback(prompts/schema/validate), mdx_text_atoms 신규 - Front: PipelineTracePanel 신규, FramePanel/SlideCanvas/Home/designAgentApi 등 갱신 + 테스트 4종 추가 - templates/phase_z2: catalog(component_expansion_registry, node_slot_mapping 신규), frames, families, slide_base 갱신 - tests/matching: phase2~26 매칭 실험 스크립트·리포트·온톨로지 전체 (미커밋 진행분) - tests: b4_v4 evidence, task5~28.5 시리즈, regression(imp95 baseline) 등 신규 테스트 대량 추가 - docs/reference: MDX 구조 인벤토리, MDX→Frame 구조 계약 문서 - scripts: mdx 계약/parity/coverage/viewport 체크, gitea comment, run sync 유틸 - .gitignore: tmp*.json, chromedriver, .orchestrator, *.pkl, Front_test* 등 임시/스냅샷 제외 미완성 작업의 보존용 스냅샷 커밋 (2026-07-02) Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
144 lines
5.4 KiB
Python
144 lines
5.4 KiB
Python
"""Phase 4: 의미 매칭만 — 5 family × 3 전략 = 15개 매트릭스
|
||
family: SBERT / KoSimCSE / E5 / Cross-encoder / Word-avg
|
||
전략: 원본 / 축약(제목+볼드) / 청크(블릿·섹션 max 평균)
|
||
"""
|
||
import sys
|
||
import json
|
||
from pathlib import Path
|
||
|
||
sys.path.insert(0, str(Path(__file__).parent))
|
||
|
||
from common import load_figma_texts
|
||
from extract_units import extract_units
|
||
from methods import (
|
||
method_sbert_sentence, method_sbert_summary, method_sbert_chunk,
|
||
method_kosimcse, method_kosimcse_summary, method_kosimcse_chunk,
|
||
method_e5, method_e5_summary, method_e5_chunk,
|
||
method_cross_encoder, method_cross_encoder_summary, method_cross_encoder_chunk,
|
||
method_wordavg, method_wordavg_summary, method_wordavg_chunk,
|
||
)
|
||
|
||
ROOT = Path(r"d:\ad-hoc\kei\design_agent")
|
||
PREVIEW_DIR = ROOT / "data" / "figma_previews"
|
||
|
||
UNIT_ORDER = [
|
||
("MDX01-intro", "중목차 앞 본문"),
|
||
("MDX01-intro-details", "팝업"),
|
||
("MDX01-1", "중목차"),
|
||
("MDX01-2", "중목차"),
|
||
("MDX01-2-image", "이미지"),
|
||
("MDX01-2-details", "팝업+표"),
|
||
("MDX02-1", "중목차"),
|
||
("MDX02-1-image", "이미지"),
|
||
("MDX02-2", "중목차(컨테이너)"),
|
||
("MDX02-2.1", "소목차"),
|
||
("MDX02-2.2", "소목차"),
|
||
("MDX02-2.2-table", "표"),
|
||
("MDX03-1", "중목차"),
|
||
("MDX03-2", "중목차(컨테이너)"),
|
||
("MDX03-2.1", "소목차"),
|
||
("MDX03-2.1-table", "표"),
|
||
("MDX03-2.2", "소목차"),
|
||
]
|
||
|
||
|
||
def fmt_score(s):
|
||
return f"{s * 100:.0f}%"
|
||
|
||
|
||
def main():
|
||
units = extract_units()
|
||
figma = load_figma_texts()
|
||
|
||
with open(PREVIEW_DIR / "index.json", encoding="utf-8") as f:
|
||
idx_data = json.load(f)
|
||
frame_to_short = {info["frame_id"]: sid for sid, info in idx_data.items()}
|
||
|
||
# 5 family × 3 전략 = 15개
|
||
methods_def = [
|
||
("SBERT-원본", method_sbert_sentence),
|
||
("SBERT-축약", method_sbert_summary),
|
||
("SBERT-청크", method_sbert_chunk),
|
||
("KoSimCSE-원본", method_kosimcse),
|
||
("KoSimCSE-축약", method_kosimcse_summary),
|
||
("KoSimCSE-청크", method_kosimcse_chunk),
|
||
("E5-원본", method_e5),
|
||
("E5-축약", method_e5_summary),
|
||
("E5-청크", method_e5_chunk),
|
||
("Cross-원본", method_cross_encoder),
|
||
("Cross-축약", method_cross_encoder_summary),
|
||
("Cross-청크", method_cross_encoder_chunk),
|
||
("WordAvg-원본", method_wordavg),
|
||
("WordAvg-축약", method_wordavg_summary),
|
||
("WordAvg-청크", method_wordavg_chunk),
|
||
]
|
||
|
||
print(f"[Phase 4] {len(methods_def)}개 의미 매칭 × {len(units)} 유닛 실행...")
|
||
results = {}
|
||
for i, (uid, unit_text) in enumerate(units.items(), 1):
|
||
print(f" [{i}/{len(units)}] {uid}")
|
||
results[uid] = {}
|
||
for mname, fn in methods_def:
|
||
if not unit_text.strip():
|
||
results[uid][mname] = []
|
||
continue
|
||
try:
|
||
ranked = fn(unit_text, figma)
|
||
results[uid][mname] = ranked[:3]
|
||
except Exception as e:
|
||
print(f" ERROR {mname}: {e}")
|
||
results[uid][mname] = []
|
||
|
||
# 리포트
|
||
png_rel = "../../data/figma_previews/"
|
||
lines = []
|
||
lines.append("# Phase 4 — 의미 매칭 15개 매트릭스 (5 family × 3 전략)")
|
||
lines.append("")
|
||
lines.append("### 5 family")
|
||
lines.append("- **SBERT** (jhgan/ko-sroberta) — NLI+STS 학습")
|
||
lines.append("- **KoSimCSE** (BM-K/KoSimCSE-roberta) — 대조학습")
|
||
lines.append("- **E5** (intfloat/multilingual-e5-base) — retrieval, query/passage 비대칭")
|
||
lines.append("- **Cross-encoder** (Dongjin-kr/ko-reranker) — 쌍 직접 채점")
|
||
lines.append("- **WordAvg** — 단어 임베딩 평균 (FastText 계열)")
|
||
lines.append("")
|
||
lines.append("### 3 전략")
|
||
lines.append("- **원본**: 전체 텍스트")
|
||
lines.append("- **축약**: 제목(#/##/###) + 볼드(**xx**) 라벨만")
|
||
lines.append("- **청크**: 블릿/섹션 단위 쪼개서 각 MDX chunk → 최대 Figma chunk 유사도 → 평균")
|
||
lines.append("")
|
||
|
||
for i, (uid, kind) in enumerate(UNIT_ORDER, 1):
|
||
lines.append(f"---")
|
||
lines.append("")
|
||
lines.append(f"## {i}. {uid} ({kind})")
|
||
lines.append("")
|
||
lines.append("| 방법 | 1순위 | 2순위 | 3순위 |")
|
||
lines.append("|------|-------|-------|-------|")
|
||
for mname, _ in methods_def:
|
||
cells = [mname]
|
||
top3 = results[uid].get(mname, [])
|
||
if not top3:
|
||
cells += ["-", "-", "-"]
|
||
else:
|
||
for fid, score in top3:
|
||
short = frame_to_short.get(str(fid), "?")
|
||
info = idx_data.get(short, {})
|
||
png_file = info.get("png", "")
|
||
title = info.get("title_text", "").strip().replace("\n", " ") or ""
|
||
if len(title) > 15:
|
||
title = title[:15] + "…"
|
||
cell = f"<br>**{short}** ({fmt_score(score)})<br>{title}"
|
||
cells.append(cell)
|
||
while len(cells) < 4:
|
||
cells.append("-")
|
||
lines.append("| " + " | ".join(cells) + " |")
|
||
lines.append("")
|
||
|
||
out_path = Path(__file__).parent / "MATRIX_PHASE4.md"
|
||
out_path.write_text("\n".join(lines), encoding="utf-8")
|
||
print(f"\n완료: {out_path}")
|
||
|
||
|
||
if __name__ == "__main__":
|
||
main()
|