diff --git a/tests/PROGRESS.md b/tests/PROGRESS.md index be7ab9a..be50c6a 100644 --- a/tests/PROGRESS.md +++ b/tests/PROGRESS.md @@ -35,7 +35,7 @@ Phase F (후속 모듈) ░░░░░░░░░░░░░░░░░ | **C.2** taxonomy v2 라벨링 (r1→r2→r3→final→final_r2) | ✅ 32 frame 전체 라벨링 + 수동 오버라이드 3건 | | **C.3** Holdout 라벨링 + V1~V4 합리성 평가 | ✅ | | **C.4** V3 매칭 v2 (r2→r3→r4→r5) | ✅ TARGET 4/4 달성 | -| **C.5** V4 재실행 (32 frame 전체) | ✅ TARGET 3/4 (02-2.2 실패) | +| **C.5** V4 재실행 (32 frame 전체) | ✅ TARGET 4/4 — 2026-07-02 재검증: v4_full32_result.yaml 에서 02-2.2 정답 F14 = rank1/use_as_is/0.939 (anchor 재라벨링 반영본, GitHub issue #4) | | **C.6** V1 가중치 검증 | ✅ Logistic Regression 0.414/0.320/0.265, LOOCV 4/4 | | **C.7** BM25 / IDF 비교 | ✅ 현 방식 우위 (4/4 vs BM25 3/4) | | **C.8** V4 slot 축 ablation | ✅ Top-1 매칭 7/7 동일 (slot 영향 약함) | @@ -54,7 +54,7 @@ Phase F (후속 모듈) ░░░░░░░░░░░░░░░░░ | # | 약점 | 발견 시점 | 개선 우선순위 | |---|---|---|---| -| 1 | **02-2.2 매칭 실패** — 정답 Frame 14 가 V4 순위 7위, 모든 후보 reject | C.5 | 🥇 1순위 | +| 1 | ~~**02-2.2 매칭 실패**~~ **해소됨 (2026-07-02 확인)** — 현행 v4_full32_result.yaml 에서 F14 rank1/use_as_is. "순위 7위" 는 V3 Top-5 한정 평가본(구 r2 파일) 기준이었음 | C.5 | ~~🥇 1순위~~ 완료 | | 2 | **MDX 콘텐츠 성격 분석 부정확** — 키워드 사전 매칭이라 MDX 01-2 가 `policy_requirements` 로 오분류 (실제 `comparative_matrix`) | C.4 | 🥈 2순위 | | 3 | **MDX 시각 의도 분석 부정확** — 동일 한계 | C.4 | 🥈 2순위 | | 4 | **편집 슬롯 의미 매핑 부재** — "BIM → col_a_label" 매핑 없음. 표 첫 행만 추출 | C.5 | 🥉 3순위 | @@ -70,13 +70,13 @@ Phase F (후속 모듈) ░░░░░░░░░░░░░░░░░ ## 다음 단계 (제안) -1. **Phase E.5 (02-2.2 교정)** — 1~2 일, TARGET 100% 달성 +1. ~~**Phase E.5 (02-2.2 교정)**~~ — 완료 확인 (2026-07-02, TARGET 4/4) 2. **Phase E.1 + E.2 (LLM 분석)** — 3~5 일, V3 정확도 향상 3. **Phase E.3 + E.4 (슬롯 의미 매핑)** — 5~7 일, V4 slot 축 진짜 역할 부여 ## 핵심 메시지 (현재 시점) - ✅ **시스템 구축 완료** — V1~V4 4 단계 매칭 작동 -- ✅ **TARGET 75% (3/4)** — Logistic Regression 으로 가중치 검증, BM25 보다 우위 +- ✅ **TARGET 100% (4/4)** — 2026-07-02 재검증 (v4_full32). Logistic Regression 으로 가중치 검증, BM25 보다 우위 - ⚠️ **약점 8 가지** — 위 표 참조. 가장 큰 약점은 키워드 사전 기반 분석의 한계 (LLM 으로 대체 필요) - 🎯 **다음 목표** — TARGET 100% + 슬롯 의미 매핑 모듈 신설 diff --git a/tests/matching/CURRENT_STATUS.md b/tests/matching/CURRENT_STATUS.md index 89b7fa5..167cec7 100644 --- a/tests/matching/CURRENT_STATUS.md +++ b/tests/matching/CURRENT_STATUS.md @@ -154,3 +154,13 @@ V4 는 점수 랭킹이 아니라 **판정 라벨** 을 출력. 같은 1위라 - Figma 구조는 AI 가 파악한 결과(`templates_v1`) 를 고정 재사용 - **Holdout 은 설계 보정이 아니라 일반화 검증용** - V4 는 점수 경쟁이 아니라 실제 사용 가능성 판정 + + +--- + +## 10. 2026-07-02 재검증 (GitHub issue #4) + +- `v4_full32_result.yaml` (2026-04-29 생성) 기준 **TARGET 4/4**: + - 01-2→F18 (use_as_is 0.946) / 02-2.2→F14 (use_as_is 0.939) / 03-1→F13 (0.927) / 03-2→F29 (0.920) +- 02-2.2 "정답 F14 가 rank 7 / reject" 기록은 **V3 Top-5 한정 평가본(구 v4_template_fit_r2_result.yaml) 기준** — full32 평가 + anchor 재라벨링 반영 후 해소. +- Holdout all-reject (02-2.1 usable=0, 04-1 usable=0) 는 C1 catalog gap — Emergency P2/P3 의 ai_adaptation / generic_fallback 경로가 런타임에서 처리 (issue #9 검증 완료).