基于 Speechace 与 BoldVoice 真实产品界面的实证回溯,为 MindSync 制定不可被复制的定位主张。
本次回溯的价值不在"又看了一遍竞品",而在于:竞品的真实界面实证了我们此前的三个技术与战略判断,把 proposal 从推测升级为事实。下面逐条呈现证据。
五帧竞品界面,分两组,各证实一件对 MindSync 决策至关重要的事。
walk 一词被拆成 W / AO / K 三个音,AO 被标红并给出 "Sound like ER"——不是"这里错了",而是"你发成了 ER"。这正是我们原型 A3 页「/ð/ 发成 /d/」所依赖的 sound_most_like 能力。
✓ 实证:选型决策中赌的替换音素字段,眼见为实。第一技术风险确定解除。
绿色对勾 "You got it!"、林间散步的配图、朴素的句子跟练——这是给全球出版商和 K12 的中性模板。它只做到"感知"层,没有口腔/气流的矫正层,也没有形象叙事。
✓ 空位:感知之后怎么改、以及为谁而改(高净值形象),Speechace 都没碰。
"Security Guard 说暗号"、仪表盘从 FAIL 到 PASS、"You're sounding more Chinese than American"——这是把发音诊断包装成病毒游戏,为获客服务。
✓ 可借鉴:BP 6.2「直播间发音诊断当场转化」的最佳参照,这套钩子我们能复刻。
Oracle 猜出 "Chinese, from Xi'an 55% · Chengdu / Wuhan" 并在地图上点亮——这是口音画像/溯源,输出的是"你像哪种母语背景",不是"你哪个音发错了"。
✓ 实证:印证我们的纠正——HuBERT 该做口音画像(趣味+获客),音素诊断另走引擎。
用你的音频生成 British / American / Australian 三个动物头像模仿版,一键 "Share Your Results"。整个体验是为分享和拉新设计的,卡通头像是刻意的娱乐化——它无意做高净值,也无意做矫正。
✓ 空位:BoldVoice 越好玩,越远离"身份资产"叙事。高净值严肃场被它主动让出。
把 MindSync 与三类竞品放在同一张表上逐能力比对。灰=缺失,青=具备且为差异化。
| 能力维度 | Speechace 评测 API |
BoldVoice C 端 App |
ELSA C 端+API |
大厂 流利说/多邻国 |
MindSync |
|---|---|---|---|---|---|
| 音素级评分 | ✓ 强 | ✓ | ✓ | ✓ 基础 | ✓ 采购 |
| 替换音素诊断 (发成了什么) | ✓ 图1实证 | △ | △ | ✗ | ✓ 采购 |
| 口腔/气流矫正 (舌位怎么放) | ✗ | ✗ | ✗ | ✗ 靠真人 | ✓ 独有壁垒 |
| 偏误知识图谱 (成因→路由→排序) | ✗ | ✗ | ✗ | ✗ | ✓ 独有壁垒 |
| 口音画像/溯源 | ✗ | ✓ 图3/5实证 | ✗ | ✗ | ✓ 复刻(获客) |
| 英美双口音 | ✓ | 美音为主 | 美音为主 | 美音为主 | ✓ |
| 中文母语专项 | ✗ 通用 | ✗ 全球 | ✗ 195国 | △ 有数据未专精 | ✓ 唯一专注 |
| 高净值形象叙事 | ✗ 教育 | ✗ 娱乐 | ✗ 大众 | ✗ 应试 | ✓ 唯一定位 |
| 真人 1v1 出口 | ✗ | ✓ 教练视频 | ✗ | △ 训练营 | ✓ 高净值Concierge |
两轴:横轴 = 从「感知诊断」到「矫正训练」,纵轴 = 从「大众/娱乐」到「高端/形象」。竞品全部落在左侧与下方,右上象限空着。
口腔气流矫正 + 偏误知识图谱来自 Jessie 8 年肌肉训练迁移,是买不到的教学知识。竞品能买同一个评测引擎,但买不到"检测出偏差后该怎么改"这套内容。
只服务中文母语者 → 积累的是华人英语偏误 × 口腔纠正路径的专项标注集。通用竞品要泛化全球口音,我们在垂直人群上越用越准。数据权属归我方(Speechace 条款确认)。
"声音形象管理"锚定的是医美/造型的价格心智,不是网课。娱乐化的 BoldVoice 和教育化的 Speechace 都无法向上兼容到高净值严肃场——品牌基因决定了它们进不来。
大厂若入场做 AI 发音评测,做的是"感知"层(他们擅长的),恰好替我们免费教育市场——教会用户"发音可以被 AI 诊断"。而"矫正 + 高净值形象 + 华人专项"是规模化打法接不住的非标高端需求,反而在大厂教育完市场后,被我们以国际背书收割。BoldVoice 图3/5 的玩法证明:连头部玩家都把资源投在"好玩的诊断"上,矫正的深水区无人涉足。
回溯不只为分析,更为校准产品动作。以下五条直接改写开发优先级。
| # | 建议 | 来自哪帧证据 | 纳入 |
|---|---|---|---|
| 1 | 矫正层是唯一不可省的差异化:口腔可视化 + 气流线 + 知识图谱路由必须是 MVP 核心,不能因赶工砍成"评分+跟读"(那样就变成了 Speechace 皮肤)。 | 图2(竞品止于感知) | 已在 MVP |
| 2 | 口音画像做成获客钩子:复刻 BoldVoice「猜你口音/说暗号」玩法,用 HuBERT 实现,投放到矩阵号直播间做当场诊断转化。 | 图3/5(病毒玩法) | Phase 2 |
| 3 | 形象叙事贯穿到每一帧 UI:拒绝绿色对勾"You got it"式的教育感,坚持仪器化、克制、高净值的视觉语言(Design System 已定)。 | 图2/4(竞品调性) | 已在 DS |
| 4 | replace 分享文案的价值锚:BoldVoice 分享"我像考拉",我们分享"我的声音形象超过 68% 同行"——把社交货币从娱乐换成身份。 | 图4(分享机制) | 已在 A8 |
| 5 | 引擎签约锁定 sound_most_like:图1 证明该能力在产品级可用,Phase 0 PoC 重点验证其对中式偏误对的命中率与音素簇粒度。 | 图1(替换音素) | Phase 0 |
"我们做过完整的竞品回溯。Speechace 是最好的『耳朵』——它真的听得出你把 walk 发成了 wERk(我们有它的产品实拍);BoldVoice 是最好的『玩具』——它把口音检测做成了病毒游戏,猜你是西安人还是成都人。但它们都停在那儿了:没有一家告诉你,检测出问题之后,舌头该放哪、气流该往哪走。那道从『感知』到『矫正』的门槛,需要的不是更强的模型,而是一套把肌肉训练迁移到发音的教学方法论——这正是 Jessie 八年瑜伽教练经验能给、而大厂产品经理给不了的东西。我们买最好的耳朵,配上唯一的矫正大脑,只服务最舍得为声音形象付费的华人。这个位置,被四家竞品的基因结构性地让给了我们。"
此段可直接用于 BP 竞品页更新、路演问答、投资人一对一。配套证据(图1–5)建议作为 BP 附录,把"我们分析过竞品"从口头承诺变成可验证的尽调材料。