# Phase 0 引擎基准实验协议

## 1. 实验目的

判断 SpeechAce 的 `sound_most_like` 与音素分数能否支撑中文母语者的具体矫正路由。实验不以“API 能返回结果”为成功，而以“对目标偏误的判断足够可信”为成功。

## 2. 参与者结构

只招募 18 岁以上成年人。

| 组别 | 人数 | 用途 |
|---|---:|---|
| 目标用户 | 20 | 评估自然发生的中式偏误 |
| 高水平对照 | 5 | 测量误报率和正确发音分布 |
| 控制偏误校准 | 5 | 验证引擎对明确替换音的上限；不计入自然样本主指标 |

每人朗读 10–12 条句子，每句两次，预计 600–720 条录音。

## 3. 候选诊断句

正式采集前必须由 Jessie 审核文本自然度、目标音位置和教学价值。

| ID | 目标偏误 | 句子 |
|---|---|---|
| TH-01 | `/θ/→/s/` | I think three things are worth considering. |
| TH-02 | `/θ/→/s/` | The third theme needs more thought. |
| DH-01 | `/ð/→/d/` | Those decisions matter more than the others. |
| DH-02 | `/ð/→/d/` | They gathered the data this Thursday. |
| RL-01 | `/r/→/l/` | Laura will review the quarterly report. |
| RL-02 | `/r/→/l/` | The regional leader arrived early. |
| NL-01 | `/n/→/l/` | Linda needs a new online plan. |
| NL-02 | `/n/→/l/` | No one learned the new name. |
| VW-01 | `/v/→/w/` | We value every view from our visitors. |
| VW-02 | `/v/→/w/` | Victor will review the video. |
| FC-01 | 词尾辅音 | The client asked for a fast and clear response. |
| FC-02 | 词尾辅音 | We checked the last draft and sent it back. |

## 4. 录音规范

- 采样：16 kHz、16 bit、单声道优先。
- 单条时长：建议 3–10 秒。
- 距离：手机距离嘴部约 20–30 厘米。
- 每句录制两次，中间间隔至少 3 秒。
- 第一次按正常状态朗读，不能提示目标音。
- 第二次仍自然朗读，不要求故意模仿错误。
- 记录设备、操作系统、网络类型和环境噪声等级。
- 文件名：`{participant_id}_{prompt_id}_{attempt_no}.{ext}`。

## 5. 双教练标注流程

两名教练不知道 SpeechAce 结果，分别完成：

1. 目标音素是否正确。
2. 实际最接近的音素。
3. 严重度：0 正确、1 轻微、2 明显、3 严重影响理解。
4. 是否发生音节/词尾脱落。
5. 标签置信度：高、中、低。

两人完成后才允许查看分歧。分歧样本由两人共同裁决，生成 `adjudicated_*` 字段。

## 6. 主指标

按偏误类型分别计算，不能只报告总体准确率。

- Precision：引擎说发生某偏误时，有多少被人工确认。
- Recall：人工确认的偏误中，引擎找出了多少。
- F1：Precision 与 Recall 的调和平均。
- Specificity：正确发音被正确放行的比例。
- Test-retest consistency：同一参与者两次朗读得到相同结论的比例。
- Score stability：两次录音音素分数绝对差的中位数。
- P50/P95 latency：录音停止到结果返回的端到端耗时。
- Failure rate：超时、无结果、解析失败的比例。
- Inter-rater agreement：两名教练在裁决前的一致性，建议 Cohen's kappa ≥ 0.75。

## 7. 路由门槛

具体矫正文案优先保护 Precision：

- `Precision ≥ 85%` 且 `Recall ≥ 70%`：允许显示“你更像发成了 /x/”。
- 未达到上述门槛但音素低分：只显示“这个音还不稳定”及通用纠正。
- 引擎和录音质量均不足：要求重新录音，不生成具体诊断。

至少 3 类偏误达到具体路由门槛，才允许进入 Phase 1 的全自动诊断设计。

## 8. 排除规则

- 录音损坏、明显截断或多人同时说话。
- 朗读文本与题目不一致。
- 参与者故意夸张模仿错误，但样本未标为校准组。
- 人工裁决置信度为低且无法达成一致。
- 使用未授权录音。

所有排除必须记录原因，不能直接删除不利样本。

