声纹技术（五）：声纹分割聚类技术

5.1　分割聚类：更好地理解对话语音

5.1.1　关于名称与历史

声纹分割聚类（speaker diarization）是声纹领域里仅次于声纹识别的第二大课题，其难度远大于声纹识别。声纹识别所解决的问题可以简单概括为——“这是谁说的”，而这其中便包含了一个假设，那就是已知待识别的语音中，有且仅有一个说话人的声音。而在声纹分割聚类问题中，我们却推翻了这个假设，也就是说，一段语音中可以包含多个说话人交替说话的声音。因此，声纹分割聚类所解决的问题可以概括为——“谁在什么时间说的”（who spoke when）。

英文中diarization 一词，来源于单词diary，也就是日记或日志。从diary 到动词diarize，再到名词diarization，从字面来说，可以理解为“使……成为日志”，或者说“日志化”。一般而言，一篇日志通常会记载在一天的时间里，什么人在什么时间做了什么事。那么引申到speaker diarization，自然就可以理解为“什么人在什么时间说了什么话”。

关于speaker diarization 这个名称最早的由来，已经难以考究了。一些早期的文献直接将该问题称作speaker segmentation and clustering [114，115]，这也是为什么较多的中文文献将其翻译为“声纹分割聚类”[116]。不过随着该领域的发展，尤其是近年来监督式方法（见5.5 节）甚至是端到端模型（见5.5.6 节）的出现，“分割聚类”这个名称已经不再合适了。无论是分割还是聚类，都可以用其他方法来替代。笔者比较喜欢的另一个中文翻译是“声纹分时归档”

相关阅读:
令人拍手叫绝的运维小技巧
直播课堂系统，打造出超过线下培训场景200%的在线学习课堂
Codeforces Round #833 (Div. 2)
Python编程元组的创建
Java安全机制之一——SecurityManager和AccessController
yii2 field 条件筛选
不会就坚持33天吧单调栈滑动窗口想队列
解决Chrome无法自动同步书签
Python---while循环中else的基本语法（是同级关系）
teb局部路径规划参数调节--差速小车

原文地址：https://blog.csdn.net/u013250861/article/details/125452600

声纹技术（五）：声纹分割聚类技术

5.1 分割聚类：更好地理解对话语音

5.1.1 关于名称与历史

5.1　分割聚类：更好地理解对话语音

5.1.1　关于名称与历史