Files
C.E.L_Slide_test2/tests/matching/embeddings.py
T
KyeongminandClaude Opus 4.8 b836e79ee1 wip: phase_z2 evidence 파이프라인 + matching 실험(phase2~26) + 프론트 trace 패널 진행분 스냅샷
- src: phase_z2 composition/mapper/pipeline/placement_planner/retry, ai_fallback(prompts/schema/validate), mdx_text_atoms 신규
- Front: PipelineTracePanel 신규, FramePanel/SlideCanvas/Home/designAgentApi 등 갱신 + 테스트 4종 추가
- templates/phase_z2: catalog(component_expansion_registry, node_slot_mapping 신규), frames, families, slide_base 갱신
- tests/matching: phase2~26 매칭 실험 스크립트·리포트·온톨로지 전체 (미커밋 진행분)
- tests: b4_v4 evidence, task5~28.5 시리즈, regression(imp95 baseline) 등 신규 테스트 대량 추가
- docs/reference: MDX 구조 인벤토리, MDX→Frame 구조 계약 문서
- scripts: mdx 계약/parity/coverage/viewport 체크, gitea comment, run sync 유틸
- .gitignore: tmp*.json, chromedriver, .orchestrator, *.pkl, Front_test* 등 임시/스냅샷 제외

미완성 작업의 보존용 스냅샷 커밋 (2026-07-02)

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-07-02 17:03:42 +09:00

38 lines
1.0 KiB
Python

"""ko-sroberta embeddings for template-fit content similarity.
Model: jhgan/ko-sroberta-multitask (HuggingFace)
용도: MDX summary ↔ frame description 코사인 유사도 계산
32 frame 규모 — 벡터 DB 없이 numpy 만으로 충분
"""
import numpy as np
_model = None
def _get_model():
global _model
if _model is None:
from sentence_transformers import SentenceTransformer
_model = SentenceTransformer('jhgan/ko-sroberta-multitask')
return _model
def embed_texts(texts):
"""Batch embed. Returns numpy (N, 768)."""
model = _get_model()
return model.encode(list(texts), show_progress_bar=False, convert_to_numpy=True)
def cosine(a, b):
"""Single-vector cosine similarity."""
an = a / (np.linalg.norm(a) + 1e-12)
bn = b / (np.linalg.norm(b) + 1e-12)
return float(np.dot(an, bn))
def embed_map(id_to_text):
"""{id: text} → {id: vec(768,)}"""
ids = list(id_to_text.keys())
vecs = embed_texts([id_to_text[i] for i in ids])
return {ids[i]: vecs[i] for i in range(len(ids))}