智谱ai正式发布并开源了工业级语音合成系统 glm‑tts。
官方介绍显示,仅需3秒的语音片段,GLM‑TTS 即可精准捕捉目标说话人的音色特征与语调习惯。该模型在通用文本朗读、情感化配音、教育口语评测、电子书播讲、智能有声客服等多种实际应用场景中,均可输出自然连贯、高度拟人化的语音效果。
GLM‑TTS 采用两阶段语音生成架构,并在训练过程中融合基于 GRPO 的强化学习策略,在公开基准测试的「字错误率(CER)」与「情感表达准确度」两项关键指标上,均达到当前开源模型中的最优水平(SOTA)。


该模型基于 GRPO 框架,设计了多维度奖励函数与稳定性增强机制,在确保可控性的前提下,显著提升了语音的表现力与鲁棒性。

其强化学习模块创新性地结合真实训练数据与高质量合成数据构建训练样本,实现了近乎零成本的数据扩充。通过与优化后的训练算法深度协同,有效抑制了奖励欺骗(reward hacking)现象,保障了模型性能的真实性与泛化能力,即便面对未参与训练的新样本,依然保持优异表现。
版权声明:除非特别标注,否则均为本站原创文章,转载时请以链接形式注明文章出处。
还木有评论哦,快来抢沙发吧~