算法与评分

读懂连续评分:音色分、自然分与音高怎样参与计算

想了解 continuous 规则,或发现不同声音偏好下的综合分不同。

带着一个问题来读

准确阅读当前计算规则,避免把算法权重当成人类听觉或生理机制。

适合:希望把产品分数、个人听感和实际交流目标分开理解的用户。

一、理解这项主题#

Pitchee 的综合分是当前声音偏好下的算法加权结果。完整言语中的性别感知还涉及音色、音高、语调、表达方式、语言和听者情境;这些影响不能用下列权重完整描述。音色分等模型输出可能误判;重复出现相同低分也可能是系统性偏差。规则解释的是软件怎样计分,不能证明实际听感,基于分数推荐的练习可以跳过。

音色分(VFP)是模型对音色女性向参考特征的估计,分数较高或较低分别在两种方向的公式中起不同作用。它不是共振峰、声道长度或性别身份的直接测量。自然分(Naturalness)估计录音相对日常说话的听感,以及刻意造作或风格化的程度。它不判断真人或机器人,也不测量声带健康。高音色分、高音高而自然分较低可以同时出现,例如一段音色较明亮、音高较高但表达十分戏剧化的朗读。

下文的 F0 是检测到的平均基频,单位为 Hz,用于辅助观察音高;B 表示基础分,F 表示最终分。女性向计算先将音色分 SS 与自然分 NN 限制在 0–100,并定义:

Sr=S/100S_r=S/100 Nr=clamp⁡((N−40)/50,0,1)N_r=\operatorname{clamp}((N-40)/50,0,1) Fr=clamp⁡((F0−110)/90,0,1)F_r=\operatorname{clamp}((F_0-110)/90,0,1)

其中 clamp 表示将计算值限制在指定的上下界内。

B=100(0.50Sr+0.20Nr+0.15Fr+0.15SrNrFr)B=100(0.50S_r+0.20N_r+0.15F_r+0.15S_rN_rF_r)

这些系数是产品设计参数,不能解释为音色、自然感或音高在人类性别判断中的贡献率。联合项也是连续变化的:只要三个归一化输入都大于零,它就可以贡献分数,并不是等三项跨过某个达标门槛才突然奖励 15 分。它与后面的 pass_boost 是两项不同计算。基频项在 200 Hz 达到饱和,只说明继续提高音高不再增加这一项,不能据此指定个人训练目标。

例如,S = 70、N = 75、F0 = 180 Hz 时,四项分别贡献约 35、14、11.67 和 5.72 分,基础分约为 66.38。这个组合没有命中后文的特殊规则,最终分仍约为 66.38;其中的 5.72 分来自基础公式的联合项。示例数值仅用于演示计算。

男性向使用另一公式:

B=F=clamp⁡(60+25dF0+15dVFP,0,100)B=F=\operatorname{clamp}(60+25d_{F_0}+15d_{\mathrm{VFP}},0,100) dF0=clamp⁡((165−F0)/75,−1,1)d_{F_0}=\operatorname{clamp}((165-F_0)/75,-1,1) dVFP=clamp⁡((50−S)/50,−1,1)d_{\mathrm{VFP}}=\operatorname{clamp}((50-S)/50,-1,1)

男性向始终返回 continuous;音高缺失时令 dF0=0d_{F_0}=0,自然分目前不参与这项综合分。男性向并非简单反转女性向全部规则。底层字段 vfp_standard_score 在本文中统一称音色分(VFP)。

二、练习前的观察#

先确认所选声音偏好、有效音高及录音条件。女性向在音高缺失时返回 f0_unavailable,并以音色分作为基础分和最终分;有有效音高时,按以下顺序匹配规则:

条件 规则及处理
F0 > 165 Hz、N > 80、S > 50 pass_boost;比较提升候选值与基础分
F0 > 165 Hz、N < 50 high_f0_stylized_cap,上限 30
F0 ≤ 165 Hz、N ≥ 50 low_f0_natural_cap,上限 59
F0 ≤ 165 Hz、N < 50 low_f0_stylized_cap,上限 20
F0 > 165 Hz、N ≥ 50、S < 50 high_f0_male_cap,上限 59
其余有效组合 continuous,最终分等于基础分

上限表示最终分取当前分数与上限的较小值,不保证录音恰好得到该分数。命中上限规则也不代表实际发生了扣减;score_limited 仅在上限确实降低结果时为真。

pass_boost 的提升强度为:

t=min⁡((F0−165)/25,(N−80)/20,(S−50)/30,1)t=\min((F_0-165)/25,(N-80)/20,(S-50)/30,1)

候选值为 P=60+40tP=60+40t,最终分取 max⁡(B,P)\max(B,P)。规则名为 pass_boost 时,只有 P>BP>B 才会将 score_boosted 设为真。以上边界都属于当前实现,不能作为健康、能力或社会识别的分界。

这些规则的设计意图,是避免某一项较高的读数掩盖其他模型反馈。音色分较低时,高 F0 和高自然分不能无限补偿;F0 较低或自然分较低时,高音色分也不能单独推高最终结果。因此 VFP 占较大的基础权重,却不独自决定综合分。

在当前评分规则下,低 F0 的入口会优先提示观察音高,高 F0、低自然分的入口会先提示比较日常说话方式,音色不足的入口会先核对音色分与听感。这是产品安排观察重点的方式,不证明每位用户都必须按这个顺序练习。模型可能误判,自然分不能证明没有压嗓,F0 ≤ 165 Hz 也不能单独决定真实听感;若入口与个人目标不符,可以跳过。

三、可尝试的方法#

以下例句用于独立听辨或录音。在 App 的 A/B 复测中,使用当次固定文本,套用相同的观察方法即可。

  1. 先写下一个可听辨的目标,例如“把每个字都重读的朗读方式,改成向朋友说明安排”。
  2. A 版按原来的方式说:“我明天下午有空,可以一起喝杯茶。”B 版使用同一句话,只把重点放在“明天下午”,其他字按交谈语气带过。尽量保持设备、距离和环境一致。
  3. 先回听哪版更符合目标、哪版说起来更省力,再看音色分、自然分、F0 和最终分。把“听感更合适但分数未升”也如实记下。
  4. 下次以相同文本再作比较;另找一次真实对话,观察是否用得上这个表达方式。练习记录与日常使用回答的是不同问题。

四、依据与延伸阅读#

读到这里,也是向自己靠近的一步。查看原文与修订记录
回到所有文章