wip: phase_z2 evidence 파이프라인 + matching 실험(phase2~26) + 프론트 trace 패널 진행분 스냅샷
- src: phase_z2 composition/mapper/pipeline/placement_planner/retry, ai_fallback(prompts/schema/validate), mdx_text_atoms 신규 - Front: PipelineTracePanel 신규, FramePanel/SlideCanvas/Home/designAgentApi 등 갱신 + 테스트 4종 추가 - templates/phase_z2: catalog(component_expansion_registry, node_slot_mapping 신규), frames, families, slide_base 갱신 - tests/matching: phase2~26 매칭 실험 스크립트·리포트·온톨로지 전체 (미커밋 진행분) - tests: b4_v4 evidence, task5~28.5 시리즈, regression(imp95 baseline) 등 신규 테스트 대량 추가 - docs/reference: MDX 구조 인벤토리, MDX→Frame 구조 계약 문서 - scripts: mdx 계약/parity/coverage/viewport 체크, gitea comment, run sync 유틸 - .gitignore: tmp*.json, chromedriver, .orchestrator, *.pkl, Front_test* 등 임시/스냅샷 제외 미완성 작업의 보존용 스냅샷 커밋 (2026-07-02) Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,233 @@
|
||||
"""CASE 3: MDX 대/중/소목차만 vs Figma 제목/서브헤더/라벨만 매칭"""
|
||||
import sys
|
||||
import re
|
||||
import json
|
||||
import yaml
|
||||
from pathlib import Path
|
||||
|
||||
sys.path.insert(0, str(Path(__file__).parent))
|
||||
|
||||
from common import load_figma_texts
|
||||
from extract_units import extract_units # 원본 17 유닛 추출
|
||||
from methods import (
|
||||
method_tfidf, method_bm25, method_char_ngram,
|
||||
method_kiwi_bm25, method_structural,
|
||||
method_ai_metadata_matcher,
|
||||
method_hybrid_kiwi_char,
|
||||
)
|
||||
|
||||
ROOT = Path(r"d:\ad-hoc\kei\design_agent")
|
||||
PREVIEW_DIR = ROOT / "data" / "figma_previews"
|
||||
MDX_DIR = ROOT / "samples" / "mdx_batch"
|
||||
|
||||
|
||||
# MDX frontmatter title (대목차)
|
||||
MDX_TITLES = {
|
||||
"01": "건설산업 DX의 올바른 이해",
|
||||
"02": "DX의 시행 목표 및 기대효과",
|
||||
"03": "DX 실행 체계 구축 방안",
|
||||
}
|
||||
|
||||
# 각 유닛의 목차 계보 (대목차 + 중목차 + 소목차)
|
||||
UNIT_TITLES = {
|
||||
"MDX01-intro": ["건설산업 DX의 올바른 이해"],
|
||||
"MDX01-intro-details": ["건설산업 DX의 올바른 이해"],
|
||||
"MDX01-1": ["건설산업 DX의 올바른 이해", "1. 용어 정의"],
|
||||
"MDX01-2": ["건설산업 DX의 올바른 이해", "2. 용어간 상호관계"],
|
||||
"MDX01-2-image": ["건설산업 DX의 올바른 이해", "2. 용어간 상호관계"],
|
||||
"MDX01-2-details": ["건설산업 DX의 올바른 이해", "2. 용어간 상호관계"],
|
||||
"MDX02-1": ["DX의 시행 목표 및 기대효과", "1. DX의 궁극적 목표"],
|
||||
"MDX02-1-image": ["DX의 시행 목표 및 기대효과", "1. DX의 궁극적 목표"],
|
||||
"MDX02-2": ["DX의 시행 목표 및 기대효과", "2. DX 기반 Process 혁신에 따른 주체별 기대효과"],
|
||||
"MDX02-2.1": ["DX의 시행 목표 및 기대효과", "2. DX 기반 Process 혁신에 따른 주체별 기대효과",
|
||||
"2.1 업무 수행 과정(Process)의 변화"],
|
||||
"MDX02-2.2": ["DX의 시행 목표 및 기대효과", "2. DX 기반 Process 혁신에 따른 주체별 기대효과",
|
||||
"2.2 DX 시행 주체별 기대효과"],
|
||||
"MDX02-2.2-table": ["DX의 시행 목표 및 기대효과", "2. DX 기반 Process 혁신에 따른 주체별 기대효과",
|
||||
"2.2 DX 시행 주체별 기대효과"],
|
||||
"MDX03-1": ["DX 실행 체계 구축 방안", "1. DX 시행을 위한 필수 요건"],
|
||||
"MDX03-2": ["DX 실행 체계 구축 방안", "2. Process의 혁신과 Product의 변화"],
|
||||
"MDX03-2.1": ["DX 실행 체계 구축 방안", "2. Process의 혁신과 Product의 변화",
|
||||
"2.1 과정(Process)의 혁신"],
|
||||
"MDX03-2.1-table": ["DX 실행 체계 구축 방안", "2. Process의 혁신과 Product의 변화",
|
||||
"2.1 과정(Process)의 혁신"],
|
||||
"MDX03-2.2": ["DX 실행 체계 구축 방안", "2. Process의 혁신과 Product의 변화",
|
||||
"2.2 결과(Product)의 변화"],
|
||||
}
|
||||
|
||||
UNIT_ORDER = [
|
||||
("MDX01-intro", "중목차 앞 본문"),
|
||||
("MDX01-intro-details", "팝업"),
|
||||
("MDX01-1", "중목차"),
|
||||
("MDX01-2", "중목차"),
|
||||
("MDX01-2-image", "이미지"),
|
||||
("MDX01-2-details", "팝업+표"),
|
||||
("MDX02-1", "중목차"),
|
||||
("MDX02-1-image", "이미지"),
|
||||
("MDX02-2", "중목차(컨테이너)"),
|
||||
("MDX02-2.1", "소목차"),
|
||||
("MDX02-2.2", "소목차"),
|
||||
("MDX02-2.2-table", "표"),
|
||||
("MDX03-1", "중목차"),
|
||||
("MDX03-2", "중목차(컨테이너)"),
|
||||
("MDX03-2.1", "소목차"),
|
||||
("MDX03-2.1-table", "표"),
|
||||
("MDX03-2.2", "소목차"),
|
||||
]
|
||||
|
||||
|
||||
def extract_figma_titles(text):
|
||||
"""Figma texts.md에서 제목/서브헤더/라벨만 추출"""
|
||||
result = []
|
||||
lines = text.split("\n")
|
||||
include_bullets = False
|
||||
for line in lines:
|
||||
stripped = line.strip()
|
||||
if stripped.startswith("## "):
|
||||
header = stripped[3:].strip()
|
||||
# 타이틀/서브헤더/열·행 섹션 → 아래 블릿 포함
|
||||
if header in ("타이틀", "서브헤더"):
|
||||
include_bullets = True
|
||||
elif re.match(r"^(열|행|좌측|우측|상단|하단|가운데|중앙)", header):
|
||||
include_bullets = True
|
||||
# "열1: 기술 (디지털)" → "기술 (디지털)" 라벨 추출
|
||||
if ":" in header:
|
||||
result.append(header.split(":", 1)[1].strip())
|
||||
else:
|
||||
include_bullets = False
|
||||
elif stripped.startswith("### "):
|
||||
# 소제목 (세로 라벨, 상단 제목, 한자 등) 아래 블릿 포함
|
||||
include_bullets = True
|
||||
elif stripped.startswith("- ") and include_bullets:
|
||||
content = stripped[2:].strip()
|
||||
# 괄호 단독 ( ) 같은 건 제외
|
||||
if content and content not in ("(", ")"):
|
||||
result.append(content)
|
||||
return " ".join(result)
|
||||
|
||||
|
||||
def build_mdx_query(unit_id):
|
||||
"""해당 유닛의 대+중+소목차 계보를 하나의 쿼리 문자열로"""
|
||||
titles = UNIT_TITLES.get(unit_id, [])
|
||||
return " ".join(titles)
|
||||
|
||||
|
||||
def fmt_score(score, method_name):
|
||||
if method_name in ("TF-IDF", "Char-ngram", "AI-Meta", "Structural", "하이브리드"):
|
||||
return f"{score * 100:.0f}%"
|
||||
else:
|
||||
return f"{score:.1f}"
|
||||
|
||||
|
||||
def main():
|
||||
# Figma texts.md를 제목만 추출한 버전
|
||||
figma_raw = load_figma_texts()
|
||||
figma_titles = {fid: extract_figma_titles(text) for fid, text in figma_raw.items()}
|
||||
|
||||
# MDX 쿼리 = 목차 계보만
|
||||
mdx_queries = {uid: build_mdx_query(uid) for uid in UNIT_TITLES}
|
||||
|
||||
with open(PREVIEW_DIR / "index.json", encoding="utf-8") as f:
|
||||
idx_data = json.load(f)
|
||||
frame_to_short = {info["frame_id"]: sid for sid, info in idx_data.items()}
|
||||
short_to_info = idx_data
|
||||
|
||||
with open(Path(__file__).parent / "metadata_db.yaml", encoding="utf-8") as f:
|
||||
metadata_db = yaml.safe_load(f)
|
||||
|
||||
# AI-Meta용 extra (CASE 1/2와 동일)
|
||||
extra_meta = {
|
||||
"MDX01-intro-details": {"concepts": ["정책", "디지털화", "BIM", "스마트건설", "사례"], "layout_hint": "popup-list"},
|
||||
"MDX01-2-image": {"concepts": ["DX", "핵심기술", "상호관계", "GIS", "BIM", "디지털트윈"], "layout_hint": "diagram"},
|
||||
"MDX01-2-details": {"concepts": ["BIM", "DX", "비교", "범위", "S/W", "프로세스", "성과품", "활용", "확장성", "수행개념", "CIVIL", "IT", "주체", "발주처", "설계사", "시공사"], "layout_hint": "compare-rows"},
|
||||
"MDX02-1-image": {"concepts": ["DX", "목표", "안전", "품질", "생산성", "소통", "신뢰"], "layout_hint": "cycle-3way"},
|
||||
"MDX02-2.1": {"concepts": ["Process", "변화", "수작업", "S/W", "체계화", "2D", "3D", "협업", "검증", "사전"], "layout_hint": "transition-list"},
|
||||
"MDX02-2.2": {"concepts": ["발주자", "시공자", "설계자", "역량", "기대효과", "3D모델", "협업", "Claim", "리스크", "품질"], "layout_hint": "persona-3col"},
|
||||
"MDX02-2.2-table": {"concepts": ["발주자", "시공자", "설계자", "필요역량", "업무", "변화", "3D", "검증", "협업", "표"], "layout_hint": "table-3col"},
|
||||
"MDX03-2.1": {"concepts": ["Process", "Analogue", "Digital", "혁신", "GIS", "BIM", "Solution", "2D", "3D", "협업"], "layout_hint": "compare-2col"},
|
||||
"MDX03-2.1-table": {"concepts": ["Analogue", "Digital", "As-is", "To-be", "2D", "3D", "문서", "행정", "시각화", "소통", "표"], "layout_hint": "compare-2col"},
|
||||
"MDX03-2.2": {"concepts": ["Product", "결과", "성과물", "품질", "Digital", "정보물", "Solution", "협업", "통합관리"], "layout_hint": "compare-2col"},
|
||||
}
|
||||
combined_meta = {**metadata_db.get("mdx_sections", {}), **extra_meta}
|
||||
|
||||
methods_def = [
|
||||
("TF-IDF", method_tfidf),
|
||||
("BM25", method_bm25),
|
||||
("Char-ngram", method_char_ngram),
|
||||
("Kiwi+BM25", method_kiwi_bm25),
|
||||
("Structural", method_structural),
|
||||
("AI-Meta", None),
|
||||
("하이브리드", method_hybrid_kiwi_char),
|
||||
]
|
||||
|
||||
# 실행
|
||||
results = {}
|
||||
for uid in UNIT_TITLES:
|
||||
query = mdx_queries[uid]
|
||||
results[uid] = {}
|
||||
for mname, fn in methods_def:
|
||||
if not query.strip():
|
||||
results[uid][mname] = []
|
||||
continue
|
||||
if mname == "AI-Meta":
|
||||
# AI-Meta는 이미 메타데이터 기반이라 본문/목차 무관 — 동일 결과
|
||||
ranked = method_ai_metadata_matcher(uid, metadata_db["figma_frames"], combined_meta)
|
||||
elif mname == "Structural":
|
||||
# Structural도 원본 텍스트 구조 기반 — 목차만으로는 거의 의미 없음
|
||||
# 원본 텍스트 넣어서 실행 (동일 결과)
|
||||
unit_text_raw = extract_units().get(uid, "")
|
||||
ranked = fn(unit_text_raw, figma_raw)
|
||||
else:
|
||||
# 핵심: 목차 쿼리 + 제목만 추출 Figma
|
||||
ranked = fn(query, figma_titles)
|
||||
results[uid][mname] = ranked[:3]
|
||||
|
||||
# 리포트
|
||||
lines = []
|
||||
lines.append("# CASE 3 — 대·중·소목차만 매칭")
|
||||
lines.append("")
|
||||
lines.append("MDX: 각 유닛의 **대목차(파일 title) + 중목차(##) + 소목차(###) 계보**만 쿼리로 사용.")
|
||||
lines.append("Figma: texts.md의 **## 타이틀 / ## 서브헤더 / 열·행 라벨**만 사용 (본문/블릿 전체 제외).")
|
||||
lines.append("")
|
||||
lines.append("> 참고: AI-Meta는 사전 추출 메타데이터 기반이라 CASE 1/2/3에서 동일 결과. Structural은 원본 구조 기반이라 동일.")
|
||||
lines.append("")
|
||||
|
||||
png_rel = "../../data/figma_previews/"
|
||||
|
||||
for i, (uid, kind) in enumerate(UNIT_ORDER, 1):
|
||||
lines.append("---")
|
||||
lines.append("")
|
||||
lines.append(f"## {i}. {uid} ({kind})")
|
||||
lines.append("")
|
||||
lines.append(f"**MDX 쿼리**: `{mdx_queries.get(uid, '')}`")
|
||||
lines.append("")
|
||||
|
||||
lines.append("| 방법 | 1순위 | 2순위 | 3순위 |")
|
||||
lines.append("|------|-------|-------|-------|")
|
||||
for mname, _ in methods_def:
|
||||
cells = [mname]
|
||||
top3 = results[uid].get(mname, [])
|
||||
if not top3:
|
||||
cells += ["-", "-", "-"]
|
||||
else:
|
||||
for fid, score in top3:
|
||||
short = frame_to_short.get(str(fid), "?")
|
||||
info = short_to_info.get(short, {})
|
||||
png_file = info.get("png", "")
|
||||
title = info.get("title_text", "").strip().replace("\n", " ") or ""
|
||||
if len(title) > 15:
|
||||
title = title[:15] + "…"
|
||||
cell = f"<br>**{short}** ({fmt_score(score, mname)})<br>{title}"
|
||||
cells.append(cell)
|
||||
while len(cells) < 4:
|
||||
cells.append("-")
|
||||
lines.append("| " + " | ".join(cells) + " |")
|
||||
lines.append("")
|
||||
|
||||
out_path = Path(__file__).parent / "MATRIX_CASE3.md"
|
||||
out_path.write_text("\n".join(lines), encoding="utf-8")
|
||||
print(f"완료: {out_path}")
|
||||
|
||||
|
||||
if __name__ == "__main__":
|
||||
main()
|
||||
Reference in New Issue
Block a user