V1 매칭 공식의 가중치 0.30 / 0.50 / 0.20 은 왜 이 숫자인가? 데이터로 검증 가능한가?
| 방식 | standalone (핵심) | group (세트) | related (연관) | TARGET 정답 |
|---|---|---|---|---|
| 현재 (수동 설정) | 0.300 | 0.500 | 0.200 | 4 / 4 |
| Logistic Regression (학습) | 0.414 | 0.320 | 0.265 | 4 / 4 |
| OLS Linear (극단) | 1.000 | 0.053 | −0.053 | 3 / 4 |
각 TARGET 을 hold-out 하고 나머지 3개로 학습 후, hold-out 섹션에서 정답 판별.
| hold-out | standalone | group | related | 정답? |
|---|---|---|---|---|
| 01-2 | 0.402 | 0.336 | 0.262 | ✓ |
| 02-2.2 | 0.395 | 0.336 | 0.269 | ✓ |
| 03-1 | 0.413 | 0.308 | 0.279 | ✓ |
| 03-2 | 0.431 | 0.308 | 0.262 | ✓ |
→ hold-out 별 가중치가 거의 동일 (0.40±0.02 / 0.32±0.02 / 0.27±0.01). 모든 hold-out 정답 맞춤.
| 방식 | 원리 | TARGET 정답률 |
|---|---|---|
| 현재 (0.30/0.50/0.20) | 비율 × 레이어 가중 합산 | 4 / 4 |
| Logistic 학습 (0.41/0.32/0.27) | 데이터 기반 회귀 | 4 / 4 |
| IDF-weighted (세트 포함) | 순수 정보량 가중 | 3 / 4 |
| BM25 (개별 토큰) | 표준 IR | 3 / 4 |
| BM25 (세트 포함 복합 토큰) | BM25 + phrase | 3 / 4 |
0.30 / 0.50 / 0.20 은 임의 숫자가 아님.
Logistic Regression 학습 결과 0.41 / 0.32 / 0.27 과 숫자는 다르지만 TARGET 정답률 동일 (4/4),
LOOCV 4/4 — 이 범위에서 robust.
BM25 / IDF 같은 표준 IR 기법보다 오히려 정답률 높음.