竞品回溯 · 定位主张 · 保密

别人做了什么,
我们站在哪里

基于 Speechace 与 BoldVoice 真实产品界面的实证回溯,为 MindSync 制定不可被复制的定位主张。

编制:CTO Office · v1.0 · 2026-07 · 证据来源:竞品产品实拍 5 帧 · 配套《技术方案》《评测引擎选型决策》
01

一句话主张

定位主张Speechace 有最强的感知(听得出你发成了什么),BoldVoice 有最强的传播(把口音变成好玩的社交货币),但两者都没有「矫正」——没人告诉你舌头该放哪、气流该怎么走。MindSync 站的正是这个空位:「感知偏差 → 图解矫正 → 声音形象」的完整闭环,且是唯一为中文母语者、以高净值形象为叙事的那一个。

本次回溯的价值不在"又看了一遍竞品",而在于:竞品的真实界面实证了我们此前的三个技术与战略判断,把 proposal 从推测升级为事实。下面逐条呈现证据。

02

证据回溯:竞品实拍说明了什么

五帧竞品界面,分两组,各证实一件对 MindSync 决策至关重要的事。

A 组 · Speechace 引擎能力(图 1–2)

图1 · Speechace 音节级面板

替换音素诊断,真实产品里在跑

walk 一词被拆成 W / AO / K 三个音,AO 被标红并给出 "Sound like ER"——不是"这里错了",而是"你发成了 ER"。这正是我们原型 A3 页「/ð/ 发成 /d/」所依赖的 sound_most_like 能力。

✓ 实证:选型决策中赌的替换音素字段,眼见为实。第一技术风险确定解除。

图2 · Speechace 句子跟练结果

但它的产品皮肤是"通用教育",不是"高净值形象"

绿色对勾 "You got it!"、林间散步的配图、朴素的句子跟练——这是给全球出版商和 K12 的中性模板。它只做到"感知"层,没有口腔/气流的矫正层,也没有形象叙事

✓ 空位:感知之后怎么改、以及为谁而改(高净值形象),Speechace 都没碰。

B 组 · BoldVoice 口音玩法(图 3–5)

图3 · Accent Detector 游戏

把口音检测做成了"闯关游戏"

"Security Guard 说暗号"、仪表盘从 FAIL 到 PASS、"You're sounding more Chinese than American"——这是把发音诊断包装成病毒游戏,为获客服务。

✓ 可借鉴:BP 6.2「直播间发音诊断当场转化」的最佳参照,这套钩子我们能复刻。

图5 · Accent Oracle 口音溯源

它的 HuBERT 是口音识别器,不是诊断器

Oracle 猜出 "Chinese, from Xi'an 55% · Chengdu / Wuhan" 并在地图上点亮——这是口音画像/溯源,输出的是"你像哪种母语背景",不是"你哪个音发错了"。

✓ 实证:印证我们的纠正——HuBERT 该做口音画像(趣味+获客),音素诊断另走引擎。

图4 · 三口音模仿卡片

social-first:口音是社交货币,不是训练

用你的音频生成 British / American / Australian 三个动物头像模仿版,一键 "Share Your Results"。整个体验是为分享和拉新设计的,卡通头像是刻意的娱乐化——它无意做高净值,也无意做矫正。

✓ 空位:BoldVoice 越好玩,越远离"身份资产"叙事。高净值严肃场被它主动让出。

三条被实证的判断① Speechace 的替换音素能力真实存在(图1)→ 我们的核心体验有地基;② HuBERT 的成熟用法是口音画像而非诊断(图3/5)→ 我们的技术分工正确;③ 两家竞品都刻意停在"感知/娱乐",都没做"矫正 + 高净值形象"(图2/4)→ 我们的定位空位真实存在。
03

能力回溯矩阵

把 MindSync 与三类竞品放在同一张表上逐能力比对。灰=缺失,青=具备且为差异化。

能力维度 Speechace
评测 API
BoldVoice
C 端 App
ELSA
C 端+API
大厂
流利说/多邻国
MindSync
音素级评分✓ 强✓ 基础✓ 采购
替换音素诊断
(发成了什么)
图1实证✓ 采购
口腔/气流矫正
(舌位怎么放)
✗ 靠真人✓ 独有壁垒
偏误知识图谱
(成因→路由→排序)
✓ 独有壁垒
口音画像/溯源图3/5实证✓ 复刻(获客)
英美双口音美音为主美音为主美音为主
中文母语专项✗ 通用✗ 全球✗ 195国△ 有数据未专精✓ 唯一专注
高净值形象叙事✗ 教育✗ 娱乐✗ 大众✗ 应试✓ 唯一定位
真人 1v1 出口✓ 教练视频△ 训练营✓ 高净值Concierge
读表结论横向看,MindSync 在"音素评分/替换诊断/口音画像"这些可采购或可复刻的能力上不落后;而在"口腔气流矫正 / 偏误知识图谱 / 中文母语专项 / 高净值叙事"这四行——四家竞品全是 ✗,MindSync 全是 ✓。壁垒不在能力清单的长度,在这四行别人的空白。
04

定位地图:空位在哪里

两轴:横轴 = 从「感知诊断」到「矫正训练」,纵轴 = 从「大众/娱乐」到「高端/形象」。竞品全部落在左侧与下方,右上象限空着。

诊断/感知 ← 产品价值 → 矫正/训练
大众/娱乐 ← 人群/调性 → 高端/形象
高端 · 偏诊断
高端 · 矫正 ★空位
大众 · 诊断
大众 · 矫正
Speechace
诊断强 · 中性教育
BoldVoice
诊断 · 娱乐化
ELSA
诊断+练 · 大众
流利说/多邻国
练 · 应试/大众
MindSync ★
矫正闭环 · 高净值形象
为什么这个空位没人抢不是别人没看见,是别人进不来(详见 05)。Speechace 是 API 公司不做 C 端;BoldVoice 的娱乐基因和全球口音定位与"华人高净值严肃场"天然相斥;大厂的应试蛋糕太大、发音不是评分项、且缺跨学科(肌肉训练)的方法论。空位是被结构性锁住的,不是暂时的。
05

为什么这个定位可持续

🔒 方法论壁垒

口腔气流矫正 + 偏误知识图谱来自 Jessie 8 年肌肉训练迁移,是买不到的教学知识。竞品能买同一个评测引擎,但买不到"检测出偏差后该怎么改"这套内容。

🔒 数据壁垒

只服务中文母语者 → 积累的是华人英语偏误 × 口腔纠正路径的专项标注集。通用竞品要泛化全球口音,我们在垂直人群上越用越准。数据权属归我方(Speechace 条款确认)。

🔒 定位壁垒

"声音形象管理"锚定的是医美/造型的价格心智,不是网课。娱乐化的 BoldVoice 和教育化的 Speechace 都无法向上兼容到高净值严肃场——品牌基因决定了它们进不来。

大厂博弈:不赌它不做,赌它做了之后我们的赢面

大厂若入场做 AI 发音评测,做的是"感知"层(他们擅长的),恰好替我们免费教育市场——教会用户"发音可以被 AI 诊断"。而"矫正 + 高净值形象 + 华人专项"是规模化打法接不住的非标高端需求,反而在大厂教育完市场后,被我们以国际背书收割。BoldVoice 图3/5 的玩法证明:连头部玩家都把资源投在"好玩的诊断"上,矫正的深水区无人涉足。

06

据此定位得出的产品建议

回溯不只为分析,更为校准产品动作。以下五条直接改写开发优先级。

#建议来自哪帧证据纳入
1矫正层是唯一不可省的差异化:口腔可视化 + 气流线 + 知识图谱路由必须是 MVP 核心,不能因赶工砍成"评分+跟读"(那样就变成了 Speechace 皮肤)。图2(竞品止于感知)已在 MVP
2口音画像做成获客钩子:复刻 BoldVoice「猜你口音/说暗号」玩法,用 HuBERT 实现,投放到矩阵号直播间做当场诊断转化。图3/5(病毒玩法)Phase 2
3形象叙事贯穿到每一帧 UI:拒绝绿色对勾"You got it"式的教育感,坚持仪器化、克制、高净值的视觉语言(Design System 已定)。图2/4(竞品调性)已在 DS
4replace 分享文案的价值锚:BoldVoice 分享"我像考拉",我们分享"我的声音形象超过 68% 同行"——把社交货币从娱乐换成身份。图4(分享机制)已在 A8
5引擎签约锁定 sound_most_like:图1 证明该能力在产品级可用,Phase 0 PoC 重点验证其对中式偏误对的命中率与音素簇粒度。图1(替换音素)Phase 0
07

给投资人的一段话

"我们做过完整的竞品回溯。Speechace 是最好的『耳朵』——它真的听得出你把 walk 发成了 wERk(我们有它的产品实拍);BoldVoice 是最好的『玩具』——它把口音检测做成了病毒游戏,猜你是西安人还是成都人。但它们都停在那儿了:没有一家告诉你,检测出问题之后,舌头该放哪、气流该往哪走。那道从『感知』到『矫正』的门槛,需要的不是更强的模型,而是一套把肌肉训练迁移到发音的教学方法论——这正是 Jessie 八年瑜伽教练经验能给、而大厂产品经理给不了的东西。我们买最好的耳朵,配上唯一的矫正大脑,只服务最舍得为声音形象付费的华人。这个位置,被四家竞品的基因结构性地让给了我们。"

此段可直接用于 BP 竞品页更新、路演问答、投资人一对一。配套证据(图1–5)建议作为 BP 附录,把"我们分析过竞品"从口头承诺变成可验证的尽调材料。