声音还是刻板印象?解耦语音到语音模型中的声学性别与内容性别
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
研究探讨语音到语音(S2S)模型是否会把文字中的性别刻板印象带入输出语音。由于多数模型的输出音色固定,仅检查输出语音难以发现偏见。作者用受控实验,把男声与女声分别与男性化、中性、女性化刻板印象的段落交叉组合,在五种开源与闭源模型上以英语、西班牙语和普通话进行测试。结果显示,合成语音并未出现刻板印象漂移;但所有模型都依据内容而非声音判断说话人性别。内容每向女性化推进一步(男性化→中性→女性化),判为“女性”的几率增加1.7至24倍。当内容与声音冲突时,表现最差的模型有90%的情况误判性别;两者一致时误判率仅2%。偏见隐藏在性别归属环节,固定音色评测无法察觉,而随着S2S系统越来越多替真人发声,审计必须关注此处。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究背景
S2S模型已进入配音、翻译和语音代理等真实应用。与文本模型不同,它们能听到承载说话人性别信息的声音。
理想标准
忠实系统应把说话人视为“声音听起来像谁”,而不是“通常说这类话的人是谁”。
测试难点
多数S2S模型只输出单一固定音色,硬编码使得输出音色难以向刻板印象漂移,因此检查输出音色即使模型存在偏见也会显示正常。
两个研究问题
一是在模型复述输入时,文本中的刻板印象是否会改变输出音色的感知性别(音色渲染);二是模型判断说话人性别时依据声音还是内容(性别归因)。
实验设计
一个受控实验,将男声与女声和男性化、中性、女性化刻板印象的段落交叉组合,覆盖五个开源与闭源模型、英语、西班牙语和普通话。
主要发现一
渲染出的音色没有表现出刻板印象漂移,即音色环节保持稳定。
主要发现二
所有模型都依据内容而非声音来判断说话人性别。
量化结果
内容每向女性化推进一步(男性化→中性→女性化),被判定为“女性”的几率增加1.7至24倍。
冲突与一致对比
当内容与声音冲突时,最差模型在90%的案例中错判性别;当二者一致时,错判率仅为2%。
结论与启示
偏见隐藏在性别归因环节,固定音色评测无法看见,而随着S2S系统越来越多地为真人发声,审计必须关注这一环节。