wip: phase_z2 evidence 파이프라인 + matching 실험(phase2~26) + 프론트 trace 패널 진행분 스냅샷
- src: phase_z2 composition/mapper/pipeline/placement_planner/retry, ai_fallback(prompts/schema/validate), mdx_text_atoms 신규 - Front: PipelineTracePanel 신규, FramePanel/SlideCanvas/Home/designAgentApi 등 갱신 + 테스트 4종 추가 - templates/phase_z2: catalog(component_expansion_registry, node_slot_mapping 신규), frames, families, slide_base 갱신 - tests/matching: phase2~26 매칭 실험 스크립트·리포트·온톨로지 전체 (미커밋 진행분) - tests: b4_v4 evidence, task5~28.5 시리즈, regression(imp95 baseline) 등 신규 테스트 대량 추가 - docs/reference: MDX 구조 인벤토리, MDX→Frame 구조 계약 문서 - scripts: mdx 계약/parity/coverage/viewport 체크, gitea comment, run sync 유틸 - .gitignore: tmp*.json, chromedriver, .orchestrator, *.pkl, Front_test* 등 임시/스냅샷 제외 미완성 작업의 보존용 스냅샷 커밋 (2026-07-02) Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -0,0 +1,84 @@
|
||||
"""IDF-only 매칭: TF 빼고 공통 희귀 단어의 IDF 합으로만 매칭"""
|
||||
import sys
|
||||
import json
|
||||
import math
|
||||
from collections import Counter
|
||||
from pathlib import Path
|
||||
|
||||
sys.path.insert(0, str(Path(__file__).parent))
|
||||
|
||||
from common import load_figma_texts, tokenize_simple
|
||||
from extract_units import extract_units
|
||||
|
||||
|
||||
def main():
|
||||
figma = load_figma_texts()
|
||||
units = extract_units()
|
||||
|
||||
# 전체 corpus IDF
|
||||
all_docs = {}
|
||||
for uid, text in units.items():
|
||||
all_docs[f"MDX:{uid}"] = tokenize_simple(text)
|
||||
for fid, text in figma.items():
|
||||
all_docs[f"FIG:{fid}"] = tokenize_simple(text)
|
||||
df = Counter()
|
||||
for toks in all_docs.values():
|
||||
for w in set(toks):
|
||||
df[w] += 1
|
||||
N = len(all_docs)
|
||||
idf = {w: math.log(N / c) for w, c in df.items()}
|
||||
|
||||
with open(Path(__file__).parent.parent.parent / "data" / "figma_previews" / "index.json",
|
||||
encoding="utf-8") as f:
|
||||
idx_data = json.load(f)
|
||||
frame_to_short = {info["frame_id"]: sid for sid, info in idx_data.items()}
|
||||
|
||||
def idf_sum_score(query_tokens, doc_tokens, idf_dict):
|
||||
"""공통 단어의 IDF 합 (단순)"""
|
||||
common = set(query_tokens) & set(doc_tokens)
|
||||
return sum(idf_dict.get(w, 0) for w in common)
|
||||
|
||||
def idf_jaccard(query_tokens, doc_tokens, idf_dict):
|
||||
"""IDF 가중 Jaccard = IDF(교집합) / IDF(합집합)"""
|
||||
q_set = set(query_tokens)
|
||||
d_set = set(doc_tokens)
|
||||
common = q_set & d_set
|
||||
union = q_set | d_set
|
||||
num = sum(idf_dict.get(w, 0) for w in common)
|
||||
den = sum(idf_dict.get(w, 0) for w in union)
|
||||
return num / den if den > 0 else 0
|
||||
|
||||
# 핵심: MDX03-1 테스트
|
||||
test_units = ["MDX03-1", "MDX03-2", "MDX01-2", "MDX02-1", "MDX02-2", "MDX01-1"]
|
||||
|
||||
for uid in test_units:
|
||||
if uid not in units:
|
||||
continue
|
||||
print(f"\n═══════════════════════════════════════")
|
||||
print(f"{uid}")
|
||||
print(f"═══════════════════════════════════════")
|
||||
query_toks = tokenize_simple(units[uid])
|
||||
|
||||
# IDF sum
|
||||
scores_sum = []
|
||||
scores_jac = []
|
||||
for fid, text in figma.items():
|
||||
doc_toks = tokenize_simple(text)
|
||||
scores_sum.append((fid, idf_sum_score(query_toks, doc_toks, idf)))
|
||||
scores_jac.append((fid, idf_jaccard(query_toks, doc_toks, idf)))
|
||||
scores_sum.sort(key=lambda x: -x[1])
|
||||
scores_jac.sort(key=lambda x: -x[1])
|
||||
|
||||
print(f"\n[IDF-Sum] (공통 희귀 단어 IDF 합)")
|
||||
for i, (fid, sc) in enumerate(scores_sum[:5], 1):
|
||||
short = frame_to_short.get(str(fid), "?")
|
||||
print(f" {i}. {short} score={sc:.2f}")
|
||||
|
||||
print(f"\n[IDF-Jaccard] (IDF 가중 Jaccard)")
|
||||
for i, (fid, sc) in enumerate(scores_jac[:5], 1):
|
||||
short = frame_to_short.get(str(fid), "?")
|
||||
print(f" {i}. {short} score={sc:.3f}")
|
||||
|
||||
|
||||
if __name__ == "__main__":
|
||||
main()
|
||||
Reference in New Issue
Block a user