MindSync 英语 · 产品原型 Wireframe

v1.1 · 2026-07 · CTO Draft · 机密 · 含竞品回溯定位更新
品牌青 = 主操作 / 正确态 红 = 偏误 / 待修正 琥珀 = 进行中 / 工程标注 斜纹 = 媒体占位(视频/动画)
A0

信息架构总览(MVP 范围)

MVP 只做模块 1(48 音标音准训练)的完整闭环 + 支撑它的最小后台。虚线框为 V2 预留,架构上占位、开发上不做。

APP 用户端(iOS / Android)

流程页面版本
获客承接登录 · 目标口音选择 · 权限引导MVP
诊断闭环句子录音 → 评分 → 偏误定位 → 优先级MVP
训练闭环口腔可视化 → 视频切片 → 跟练 → 前后对比MVP
成长体系48 音标地图 · 连续打卡 · 声音形象报告(基础)MVP
商业化订阅(基础/升级)· 每日 20 分钟限额与升级引导 · 裂变海报(同侪锚点文案)MVP
私域转化Jessie 内容切片位 · 1v1 咨询入口 · 手机号/微信收集MVP
获客钩子口音画像「AI 猜你口音」(HuBERT)· H5 + 直播间引流(A9)Phase 2
进阶模块连读 · 重读弱读 · 语调 · 情景模拟V2 占位
高净值线1v1 预约 · Concierge 导流入口V2 入口先行

管理后台(Web)

能力版本
内容视频切片打点 · 题库(双口音) · 音标卡片MVP
教学法偏误知识图谱(错误→成因→纠正路由)MVP · 核心
运营用户 · 评测记录回听 · 标注工作台MVP
技术引擎调用监控 · 成本看板 · 抽检对比MVP
商业订单/订阅 · 兑换码 · 渠道归因MVP 精简版
CTO 备注 · 范围纪律MVP 的唯一验收标准:一个新用户 30 分钟内完成「诊断 → 认知自己最差的 3 个音 → 完成第 1 个音的训练 → 看到分数提升」。所有不为这条主线服务的功能一律进 V2。BP 里 0–3 个月「技术选型 + MVP 原型」、3–6 个月「300 名种子内测」的节奏,按这个范围是可达成的。

定位纪律(来自竞品回溯 2026-07)矫正层(口腔可视化 + 知识图谱路由)是唯一不可省的差异化——四家竞品全部止步于「感知」,砍掉矫正层,本产品即退化为 Speechace 的换肤。任何排期压力下可以砍报告、砍海报、砍画像,永远不砍矫正层。详见《竞品回溯与定位主张 v1》。
A1

登录与目标口音

FLOW · 首次启动
9:41●●●
M
MindSync 英语
把英语发音,从「技能短板」
打造成「身份资产」
微信登录
Apple / 手机号登录
登录即同意《用户协议》《隐私政策》
含录音数据用于评测与模型改进的授权条款
A1-1 登录国内包:微信+手机号 · 海外包:Apple/Google
工程标注录音数据使用授权必须在注册时独立勾选(PIPL 单独同意),这是未来自研模型数据资产的法律地基,不能后补。
9:41●●●
初始设置 1/2
选择目标口音
评分标准与示范音将按此切换,之后可在设置中更改
🇺🇸
美式发音
General American · 推荐
🇬🇧
英式发音
Received Pronunciation
初始设置 2/2
你的使用场景?
商务会议海外社交留学面试日常提升
开始 60 秒发音诊断 →
A1-2 目标口音 + 场景口音决定评测模型分支;场景决定诊断句语料包
工程标注口音选择写入用户档案 accent_target: us|uk,评测请求、题库 IPA 展示、TTS 示范音三处全部按此路由。这是题库双口音字段设计的消费端。
A2

首诊:句子录音

FLOW · 诊断闭环 ①
9:41●●●
M
发音诊断1 / 3 句
步骤 ① · 语音输入
朗读这个句子
用自然语速读出,系统会捕捉你的发音
目标练习句 · 商务场景
"The weather is particularly pleasant today."
重点:th · r · ticularly
🎙
点击开始录音 · 最长 20s
🔇 环境噪音检测:正常
听示范
完成录音,查看分析 →
A2-1 诊断录音页3 句诊断语料,按注册场景抽取,覆盖高频偏误音素
工程标注 · 音频采集端侧做三件事再上传:① VAD 裁掉首尾静音;② 音量/信噪比检测不达标直接拦截重录(避免浪费一次引擎调用);③ 16kHz/16bit 单声道压缩上传。噪音拦截文案要给出可操作指引(「离麦克风近一点」)。
产品标注诊断句语料 = 每句覆盖 4–6 个华人高频偏误音素,3 句合计覆盖 Top15 偏误。语料在后台 B3 题库中标记 is_diagnostic=true,可运营调整。
A3

诊断结果与偏误定位

FLOW · 诊断闭环 ②③
9:41●●●
M
AI 评分结果诊断 2/4
68
总体发音评分
82
流畅度
54
准确度
71
完整度
检测到 3 处音素偏误,正在定位具体位置…
重录
查看错误定位 →
A3-1 评分总览低分不劝退:文案框架是「定位到了可修复的问题」
9:41●●●
M
定位错误诊断 3/4
3 处音素偏误
The /ð/ wea /r/ ther is parti /kjʊ/ larly
/ð/
the · weather · this
发成 /d/
/r/
weather · particularly
发成 /l/
/kjʊ/
particularly
吞音
点击任意偏误可回听你的发音片段 ▶
智能排序 →
A3-2 音素级偏误定位核心体验:不止说错,还说「发成了什么」
工程标注 · 硬依赖本页依赖引擎返回替换音素(/ð/→/d/)与脱落检测(吞音)。若引擎只回分数,此页降级为「低分音素 + 常见偏误推断」,由 B4 知识图谱按「音素×母语」查表兜底。两条链路都要实现,error_source: engine|inferred 字段区分。
A4

训练优先级排序

FLOW · 诊断闭环 ④ · 方法论壁垒
9:41●●●
M
先练哪个?诊断 4/4
根据口腔肌肉关联权重,决定最高效的训练顺序
1
/ð/ · 齿间摩擦音
舌尖接触习惯错误,影响全句清晰度
优先
2
/r/ · 美式卷舌音
舌体偏前,与 /ð/ 修正有协同效应
其次
3
/kjʊ/ · 音节完整度
待前两项改善后自然提升
稍后
MindSync 权重算法:优先修正影响口腔肌肉整体协调的根源错误,而非表层症状。
开始训练 /ð/ →
A4-1 优先级排序把 Jessie 的教学决策编码成规则引擎 — 竞品没有
工程标注排序 = 静态知识图谱查询,非模型推理。图谱三张表:音素节点(含肌群标签)、协同边(phoneme_synergy,带权重)、偏误严重度系数。数据由 Jessie 在后台 B4 维护,工程只做查询与解释文案渲染。切勿做成黑盒模型——可解释性是卖点。
A5

音标训练单元(核心壁垒页)

FLOW · 训练闭环 ⑤⑥⑦
9:41●●●
M
/ð/ 训练5 / 9
口腔动态可视化 ★ 核心壁垒
你的舌尖位置 vs 正确位置
舌尖触碰齿龈 — 太高
你的发音
舌尖在牙缝中间 ✓
正确发音 /ð/
错误:舌尖抬高碰齿龈,发出近似 /d/ 的爆破音
正确:舌尖轻放上下牙缝中间,气流从缝隙摩擦穿出
▶ 气流动画
教练示范 →
A5-1 口腔剖面对比「错误态」由偏误类型查表渲染(推断),非实时舌位追踪
工程标注 · 动画方案48 音标 × N 偏误的剖面/气流动画用 Rive(首选)或 Lottie 做成参数化组件:一套口腔骨架,舌位/气流路径/声带振动为可调参数,由偏误数据驱动,不是 96 个视频文件。体积小、可交互(拖动进度看舌位变化)、双端一致。这是前端最大的自研工作量,预估 3–4 周含设计。

定位纪律本页 + 知识图谱路由 = 「矫正层」,是竞品回溯确认的唯一空位(四家竞品均无)。排期再紧不得降级为「评分 + 跟读」。
9:41●●●
M
/ð/ 训练7 / 9
教练视频示范
跟着视频练
教练视频切片
(第 30 集 · 02:14–02:58)
牙齿模型演示「舌尖入牙缝」
▶ 0.75x循环本段字幕
动作要点
① 嘴巴张开约两指宽 ② 舌尖轻伸入上下牙缝 ③ 气流持续穿出 + 声带振动
← 动画
开始跟练 →
A5-2 视频切片播放按偏误类型定向拉取纠错片段,非整集播放
工程标注 · 视频管线原片 88 集共 ~60GB,入库流程:转码 H.265 → HLS 多码率 → CDN。App 端按 B2 后台的打点数据 {course_id, t_in, t_out, error_tag} 播放切片。国内 CDN 需 ICP 备案主体,海外走 CloudFront——双区分发从 Day 1 设计。
A6

跟练评测与训练闭环

FLOW · 训练闭环 ⑧⑨
9:41●●●
M
巩固练习8 / 9
重读已训练的音标
按顺序录音朗读,巩固口腔肌肉记忆
当前音标
/ð/
the · weather · this · that
舌尖在牙缝中间 · 气流持续 · 声带振动
🎙
2 / 5 次 · 每次即时判定 ✓/✗
完成 5 次巩固肌肉记忆,可随时跳过
查看训练结果 →
A6-1 跟练 5 连击单音评测走「快通道」:只判目标音素,秒级返回
工程标注 · 双评测通道① 句子诊断通道:全量音素分析,容忍 2–4s;② 跟练快通道:单词/单音只判目标音素,要求 <1.5s 出结果(体感即时)。两通道共用引擎但不同参数与超时策略。快通道失败静默重试一次,再失败给「本次未采集成功」而非报错。
9:41●●●
M
训练完成9 / 9
🎉
/ð/ 训练完成
准确度前后对比
54
训练前
→ +46%
79
训练后
/ð/ 齿间摩擦音 — 基本掌握 ✓
/r/
接下来攻克 · 美式卷舌音
当前准确度 48 · 目标 80+
下一套
分享成果海报(老带新裂变)
重新体验
开始训练 /r/ →
A6-2 完成页成就感 + 裂变海报 + 下一个循环钩子,三合一
产品标注 · 合规「+46%」只能展示用户本人真实前后分数。营销物料如引用聚合提升数据,需后台 B6 留存统计口径备查(广告法效果承诺红线)。分享海报的价值锚用「身份」而非「娱乐」:文案模板「我的声音形象超过 68% 的同行」——BoldVoice 分享的是"我像考拉",我们把社交货币从娱乐换成身份(竞品回溯建议 4)。
A7

首页:48 音标地图

FLOW · 日常主入口(诊断完成后)
9:41●●●
M
MindSync🔥 连续 6 天
今日任务
/r/ 卷舌音 · 第 2 天
继续 →
遗忘曲线复习 · 到期 2 项
/ð/ · /iː/ 混合复习 · 5 分钟
复习
⏱ 今日训练时长 14 / 20 分钟 · 用完可明日再练或升级
元音 20
92
ɪ85
e71
æ63
ə
ɜː
ʌ
ɑː
ɒ
ɔː
ʊ
ɔɪ
əʊ
ɪə
辅音 28
ð79
r48
θ
v
ŋ
l
训练混淆对报告我的
A7-1 音标地图颜色 = 掌握度:青(≥80) / 琥珀(训练中) / 灰(未测) / 半透明(未解锁)
产品标注解锁顺序不是 1→48 线性,而是「诊断驱动」:用户自己的偏误音优先点亮,混淆对(/ɪ/-/iː/、/n/-/l/)作为关联节点成对推荐。数据结构必须是音标为主键、课程多对多关联,支撑这种非线性导航。复习卡由艾宾浩斯排程表(review_schedule)生成,穿插旧音标,解决「48 天后无内容」;每日 20 分钟限额同时封顶引擎成本、符合肌肉训练规律、并作为升级订阅的诱饵(会议纪要决议)。
A8

声音形象报告与订阅

FLOW · 留存与商业化
9:41●●●
M
声音形象报告每周更新
声音形象指数
74 / 100
超过 68% 的同场景用户
本周进步
/ð/
54 → 79
+25
/r/
48 → 61
+13
仍需攻克 Top3
/æ/ 梅花音 · /θ/ 清齿擦音 · /ŋ/ 后鼻音
生成完整 PDF 报告(升级订阅)
训练混淆对报告我的
A8-1 声音形象报告「形象管理」叙事的产品化载体,也是升级订阅钩子
产品标注 · 同侪锚点(替代「隐藏报告」方案)试用期不隐藏、不压分。74 分对着 100 分是「还不错」,对着同场景人群是「你排在 68% 之后,你的同行在前 10%」。高净值用户不怕分低,怕比不过同侪——分数照实给,锚点换成人群,付费动力更强且真实,与「仪器感/诚实感知」品牌人设一致。
9:41●●●
M
订阅
解锁完整训练体系
基础订阅
¥999/年
48 音标全解锁 · AI 评测无限次 · 诊断报告
升级订阅
¥1999/年
+ 完整 PDF 报告 · 行业术语词库 · V2 模块优先体验
真人 1v1
¥1699/小时
教练亲授 · 导流高净值 Concierge 体系
开通基础订阅
iOS 走 IAP(苹果抽成 30%)· 安卓/Web 走微信/支付宝、Stripe
A8-2 订阅页价格与 BP 6.4 收费模型一致 · 国内验证阶段档位
工程标注 · 支付iOS 虚拟商品必须走 IAP;定价策略需预留苹果 30% 抽成的毛利空间,或引导 Web 端购买(合规边界要守)。海外版切 Stripe + 汇率定价表。订单中心从 Day 1 支持多支付渠道对账。
A9

口音画像获客钩子(Phase 2)

FLOW · 站外获客 → 注册转化 · H5 / App / 直播间三形态
9:41●●●
M
AI 猜你口音病毒获客
读出这句暗号
"The sixth sheikh's sheep is sick."
AI 将从你的发音里听出你的口音来自哪里
你的口音更接近:中文 · 江浙一带 62%
四川 21% · 广东 9% · 其他 8%
同时定位到 3 处影响「美音纯度」的音素偏误 → 完整诊断可见
分享结果
开始完整发音诊断 →
A9-1 口音画像可独立 H5 投放 · 直播间当场诊断 · 结果页导流注册
工程标注 · HuBERT 的正确用武之地本页由 HuBERT 微调分类器实现(参照 BoldVoice 公开的 hubert-accent-identifier 架构:768 维 ×12 层 Transformer + 分类头)。只做口音画像,不做音素诊断——诊断走 Speechace。训练数据:自有用户录音(授权后)+ 公开中文口音语料,冷启动可先做「中文/非中文 + 大区」粗分类,随数据细化到省域。
产品标注 · 转化链路参照 BoldVoice Accent Detector/Oracle 玩法(竞品回溯图 3/5),但结果页锚点不同:BoldVoice 落在「好玩」,我们落在「你的口音离目标形象还差 3 个音」——娱乐引流,身份转化。直播间形态 = Jessie 现场诊断的 AI 前置筛选(BP 6.2 场景)。琥珀卡即转化钩子,点击进入 A2 完整诊断。
B1

管理后台 · 数据看板

运营每日打开的第一页。北极星指标:完成首个训练闭环的用户比例(激活率)。

admin.mindsync.app / dashboard

今日概览 · 2026-07-15

1,284累计注册
62%诊断完成率
41%首训练闭环完成率 ★
318今日评测调用
¥86今日引擎成本

7 日激活漏斗

注册 → 完成诊断 → 开始训练 → 完成闭环 → 次日回访
漏斗图占位

偏误分布 Top10(全体用户)

/ð/→/d/ 31% · /r/→/l/ 24% · /θ/→/s/ 19% …
横向条形图占位 · 反哺内容排期
CTO 备注偏误分布聚合数据是这家公司的核心数据资产雏形——它告诉内容团队先优化哪些课,也是一年后自研评测模型的训练集画像。看板从 MVP 就要有,哪怕只是每日跑批的静态图。
B2

管理后台 · 课程视频切片工作台

把 88 集原片变成可被 App 按偏误类型调用的切片库。内容团队使用频率最高的工具。

admin.mindsync.app / courses / 30 / slicing

第 30 集 · θ & ð 咬舌最新说法 已转码 HLS 关联音标 /θ/ /ð/

视频预览播放器
00:02:14 / 00:07:32
认知讲解
口型示范
纠错:发成/d/
纠错:发成/s/
跟练引导
+ 在当前帧打点
片段类型:认知 / 示范 / 纠错 / 跟练

本集切片清单

时间类型偏误标签状态
00:28–01:46认知讲解已发布
01:52–02:40口型示范demo:ð已发布
02:44–03:58纠错ð→d已发布
04:06–05:10纠错θ→s待审核
05:40–07:00跟练引导drill:ð待审核
工程标注切片不物理剪辑视频——只存打点元数据 {video_id, t_in, t_out, clip_type, error_tags[]},App 端用 HLS 按时间戳播放。好处:改打点即时生效、无需重新转码、一段视频可挂多个标签。审核流(编辑→Jessie 复核→发布)保证教学质量出口只有一个。
B3

管理后台 · 题库管理(双口音)

承接练习语料 PDF 清洗后的结构化题库。每个条目双口音 IPA,直接决定评测请求参数。

admin.mindsync.app / items?phoneme=%2Fð%2F

题库 · 筛选:主训音素 /ð/

搜索文本 / IPA…
+ 新建条目
批量导入 CSV
ID类型文本IPA-USIPA-UK主训音素难度状态
W-0301单词weather/ˈwɛðɚ//ˈweðə/ðL1已发布
W-0302单词although/ɔlˈðoʊ//ɔːlˈðəʊ/ðL2已发布
P-0088最小对立they / day/ðeɪ/ /deɪ/同左ð↔dL2已发布
S-0142句子The weather is particularly pleasant today./ðə ˈwɛðɚ…//ðə ˈweðə…/ð, r, kjʊL3诊断句
W-0309单词ket ⚠ 非词e待老师确认

条目编辑抽屉(点击行展开)

文本 · 双口音 IPA(G2P 自动生成 + 人工复核)· 涉及音素清单 · 主训音素 · 关联课程切片 · 难度 · 标记(诊断句 / 缩读对 / 双重音词)· TTS 示范音生成按钮(US/UK 各一)

QA 队列

17 条待老师确认(假词/标注冲突/英美混标)· 42 条 G2P 与 PDF 原标注不一致 → 逐条对比裁决
工程标注IPA 生成链路:CMU dict / Wiktionary G2P 自动生成双口音注音 → 与 PDF 原标注 diff → 冲突进 QA 队列人工裁决。不要手敲 IPA,48 音标 × 上千条目手敲必然引入新错误。TTS 示范音批量调 Fish Audio 生成,成本趋近于零。
B4

管理后台 · 偏误知识图谱(教学法内核)

整个产品最独特的一张表:偏误 → 发音学成因 → 纠正内容路由 → 训练优先级权重。Jessie 的教学大脑在这里数字化。

admin.mindsync.app / error-graph / ð

音素节点:/ð/ 齿间浊擦音 肌群:舌尖 · 下颌

偏误规则(华人母语迁移)

检测到成因(渲染到 App)纠正路由
ð→d舌尖抬高触齿龈成爆破动画#ð-01 + 切片 ð→d
ð→z舌尖缩后置齿背成咝音动画#ð-02 + 切片 ð→z
ð 脱落语流中省略弱读 the切片 · 弱读音ə三个易错点

协同边(训练排序权重)

关联音素关系权重
/θ/同舌位清浊对 · 顺带修复0.9
/r/舌位协同 · 建议连练0.6
/s,z/易混淆源 · 需对比训练0.5
严重度系数:影响全句清晰度 ×1.4(Jessie 可调)

发布与版本

图谱版本 v0.4 · 修改需 Jessie 审批发布 · App 端缓存 24h · 每次评测记录所用图谱版本(便于回溯「当时为什么这么推荐」)
CTO 备注 · 为什么这是核心资产评测引擎(ELSA/Speechace)人人可买,这张图谱买不到。它决定 A3 的成因文案、A4 的排序、A5 的动画选择、A5 的切片路由——四个体验高光全部由它驱动。MVP 阶段先覆盖 Top15 高频偏误即可上线,图谱随用户数据每月迭代。
B5

管理后台 · 用户与评测记录(标注工作台)

既是客服/运营工具,也是数据资产工厂:人工抽检引擎判定,产出未来自研模型的标注数据。

admin.mindsync.app / attempts?flag=review

评测记录 · 抽检队列(今日 5%抽样 + 用户申诉)

时间用户条目引擎判定回听人工标注
10:24u_8821weatherð→d (conf .81)▶ 0:03同意
10:31u_0977particularlykjʊ 脱落 (conf .64)▶ 0:04待标
10:47u_5502they/day正确 (conf .58)▶ 0:02改判:ð→d

标注面板

波形回放 · 引擎原始 JSON · 快捷键改判(同意 / 改判为 X / 音频无效)· 标注人记录 · 双人复核开关

引擎一致率周报

人机一致率 87.4%(目标 ≥85%)· 分音素细分:/kjʊ/ 类音素簇一致率仅 71% → 反馈调整置信度阈值与 UI 措辞(低置信度改用「可能」句式)
工程标注 · 数据资产管线每条评测持久化五元组:音频文件 + 条目ID + 引擎原始JSON + 图谱版本 + 人工标注(如有)。存储分层:热数据 90 天在线,之后归档冷存储。这就是 BP 里 12–18 个月「发音数据库·标签库」里程碑的实现载体——融资故事里的「数据壁垒」由此页日积月累。
B6

管理后台 · 引擎监控与成本

评测引擎是外部依赖 + 边际成本中心,必须像监控数据库一样监控它。

admin.mindsync.app / engine

评测引擎 · 运行状态

Speechace主引擎 · US/UK
1.28sP50 延迟(快通道)
3.4sP95 延迟(句子)
0.6%错误率(超时+5xx)
¥0.05单次评测均摊成本

成本看板

本月引擎支出 ¥2,340 · 单用户月均评测 74 次 · 单用户月成本 ¥3.7 → 对照 ¥999/年订阅毛利健康。
告警:单用户日调用 >300 次触发风控(脚本刷量)。

引擎抽象层(可切换)

Provider状态流量
Speechace95%
ELSA API影子对比5%
自研 HuBERT规划 · 12mo+

影子测试(Shadow Testing)

5% 流量同一音频双发两家引擎,只用主引擎结果返回用户,双方 JSON 落库对比 → 每周输出分音素准确率对照表,作为换引擎/砍价/自研决策依据。
CTO 备注抽象层接口定为 assess(audio, text, ipa_target, accent, mode) → PhonemeReport,所有 Provider 归一化到统一 PhonemeReport schema。这一层是「今天买引擎、明天换引擎、后天自研」的自由度来源,MVP 就要有,成本约一周工作量。