Files
C.E.L_Slide_test2/tests/matching/HOLDOUT_EVALUATION.md
T
KyeongminandClaude Opus 4.8 b836e79ee1 wip: phase_z2 evidence 파이프라인 + matching 실험(phase2~26) + 프론트 trace 패널 진행분 스냅샷
- src: phase_z2 composition/mapper/pipeline/placement_planner/retry, ai_fallback(prompts/schema/validate), mdx_text_atoms 신규
- Front: PipelineTracePanel 신규, FramePanel/SlideCanvas/Home/designAgentApi 등 갱신 + 테스트 4종 추가
- templates/phase_z2: catalog(component_expansion_registry, node_slot_mapping 신규), frames, families, slide_base 갱신
- tests/matching: phase2~26 매칭 실험 스크립트·리포트·온톨로지 전체 (미커밋 진행분)
- tests: b4_v4 evidence, task5~28.5 시리즈, regression(imp95 baseline) 등 신규 테스트 대량 추가
- docs/reference: MDX 구조 인벤토리, MDX→Frame 구조 계약 문서
- scripts: mdx 계약/parity/coverage/viewport 체크, gitea comment, run sync 유틸
- .gitignore: tmp*.json, chromedriver, .orchestrator, *.pkl, Front_test* 등 임시/스냅샷 제외

미완성 작업의 보존용 스냅샷 커밋 (2026-07-02)

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
2026-07-02 17:03:42 +09:00

4.1 MiB
Raw Blame History

Holdout 합리성 평가 — V1~V4 실사용 가치 비교

Holdout 3 섹션 × 각 버전 1위 프레임에 대해 사용자가 합리성을 합리적 (○) / 애매 (△) / 비합리적 (×) 3단계로 라벨링한 결과.

주의 원칙: (a) V4 라벨(use_as_is/reject) 에 끌려가지 않음 — 사용자가 "이 프레임이 이 섹션에 실제로 합리적인가" 를 직접 판단. (b) 현 단계는 1위만 평가 — 대안 탐색(2~3위) 는 별도 단계.

1. 요약 — V1~V4 합리성 점수

버전 합리성 점수 (0~300) 비율 ×
V1 🥈 100 / 300 33.3% 1 0 2
V2 100 / 300 33.3% 1 0 2
V3 30 / 300 10.0% 0 1 2
V4 🥇 235 / 300 78.3% 2 1 0

2. 섹션별 라벨 상세

01-1 — 1. 용어 정의

V1V2V3V4
01
Frame 1
개발 패러다임
× irrational (0점)
27
Frame 27
정부주도 BIM설계 전면 도입
× irrational (0점)
20
Frame 20
디지털 전환(DX)은 S/W가 필수다.
ambiguous (30점)
세모 — 완전 합리도 아니고 비합리도 아님
11
Frame 11
시공단계 BIM 모델과 정보 활용 구분
ambiguous (35점)
세모 — V3보다 약간 더 나음

02-1 — 1. DX의 궁극적 목표

V1V2V3V4
12
Frame 12
건설산업의 목표 (BIM의 목적)
rational (100점)
20
Frame 20
디지털 전환(DX)은 S/W가 필수다.
× irrational (0점)
20
Frame 20
디지털 전환(DX)은 S/W가 필수다.
× irrational (0점)
12
Frame 12
건설산업의 목표 (BIM의 목적)
rational (100점)

02-2.1 — 2.1 업무 수행 과정(Process)의 변화

V1V2V3V4
11
Frame 11
시공단계 BIM 모델과 정보 활용 구분
× irrational (0점)
29
Frame 29
과정 (Process)의 혁신
rational (100점)
03
Frame 3
국외
× irrational (0점)
29
Frame 29
과정 (Process)의 혁신
rational (100점)

3. 주요 관찰

  • V2 고유 가치 확인: 섹션 02-2.1 에서 V1 × (비합리) 를 V2 가 ○ (합리) 로 교정. → V2 의 의미 축이 V1 키워드가 놓치는 케이스를 잡아낼 수 있다는 증거.
  • V4 종합 판단 능력: 3/3 섹션에서 V4 가 다른 버전과 같거나 더 나은 합리성. 특히 02-1 (V2/V3 × → V4 ○) 과 02-2.1 (V1 × → V4 ○) 에서 V4 가 다른 축의 오답을 거르거나 좋은 신호를 선택.
  • V3 현재 세팅의 한계: V3 합리성 비율 10.0% — 평균 이하. 현재 구조 호환도(_COMPAT) 가 오히려 잘못된 방향으로 유도하는 경우 있음 (예: 02-1 에서 V3 가 V1 의 올바른 1위를 밀어내고 비합리 프레임을 올림).
  • V1 baseline 한계: 1/3 섹션만 합리 — V1 단독으로는 Holdout 난이도 케이스에 불충분함 확인.

4. 결론 — "V2 실사용 가치 증명" 여부

부분 증명. V2 가 V1 을 교정한 사례 02-2.1 가 있음. 다만 샘플 3건은 통계적 결론에 부족 — 추세를 보여주는 증거 수준.

버전별 기여도 한 줄:

  • V1 (키워드): 100/300 — baseline. 키워드가 명확히 대응될 때만 합리.
  • V2 (의미): 100/300 — V1 이 놓친 의미적 대응을 잡아낼 수 있음 (02-2.1 사례). 다만 키워드가 강한 경우 오히려 엉뚱한 방향으로 갈 위험도 있음 (02-1 사례).
  • V3 (구조): 30/300 — 현재 세팅에서는 기여 약함. 구조 taxonomy 재설계 시 재평가 필요.
  • V4 (종합 판단): 235/300 — 가장 균형 있음. V1/V2/V3 신호를 선별적으로 받아 최종 판단 잘 함.

5. 제한 + 다음 단계

제한:

  • 라벨 샘플 3건 (통계적 결론 부족)
  • 1위만 평가 — 대안 탐색(2~3위) 능력 미검증
  • 라벨 자체가 사용자 1인 판단 — 검토자 합의 없음

다음 단계 후보:

  • 옵션 3 (새 TARGET 추가) — 유형 B 케이스 확보
  • Top-3 라벨링 확장 — 대안 탐색 평가
  • V3 taxonomy 재설계 (현재 V3 약세 해결 시도)
  • Holdout 정답 특정 가능하면 옵션 1 로 정량 평가 보강