SPX to HTK Converter

在线将 Speex 录音转换为 HTK 语音识别格式

选择文件

放置文件在这里. 1 GB 最大文件大小或者注册

到

研究就绪音频

将 Speex 语音录音转换为 HTK 格式——可用于语音识别训练、测试和声学研究。

语音科学工具

在 VoIP 的 SPX 录音与顶级语音识别研究团队使用的 HTK 格式之间架起桥梁。

私密数据处理

SPX 语音数据在转换后删除，HTK 输出在 24 小时内从服务器移除。

如何转换SPX到HTK

从计算机，Google Drive，Dropbox，URL或在页面上拖拽选择文件.

选择htk或任何其他你需要的格式作为结果（支持超过200种格式）

让文件进行转换随后你可以下载你的htk文件

关于格式

Speex 是由 Jean-Marc Valin 在 Xiph.Org 基金会支持下开发的专门用于语音压缩的开源音频编解码器,于 2002 年 10 月首次发布。它面向 VoIP、会议通话以及任何需要语音高效传输的网络场景。SPX 文件将 Speex 编码的音频封装在 Ogg 容器中,将编解码器的语音优化特性与 Ogg 的流媒体能力结合在一起。支持三种采样率 — 窄带 8 kHz、宽带 16 kHz 和超宽带 32 kHz — 以及可根据语音复杂度实时调整的可变比特率编码。一个突出的优势是其无专利、BSD 许可证的特性,开发者可以自由地将其嵌入商业和开源产品中。Speex 还内置了声学回声消除、噪声抑制和自动增益控制功能,这些功能在竞争编解码器中通常需要借助外部库来实现。尽管其开发者自 2012 年起正式推荐 Opus 作为后继者,但 Speex 仍在旧版 VoIP 系统、存档录音和嵌入式设备中广泛使用,其轻量级的解码器占用空间在这些场景中仍然很有价值。

开发者: Xiph.Org Foundation

首次发布: 2002年10月15日

HTK是隐马尔可夫模型工具包（Hidden Markov Model Toolkit）的原生波形容器，该软件套件由剑桥大学工程系开发，用于语音识别研究。HTK自1993年首次发布以来，迅速成为全球计算语言学实验室的参考平台，其文件格式也随之被广泛采用。每个文件存储一系列参数向量或原始采样，前缀为12字节的头部，指定帧数、以100纳秒为单位的帧周期、每帧字节数以及标识数据类型的类型代码——选项从波形PCM到梅尔频率倒谱系数和滤波器组能量不等。这种灵活性使单一容器既能承载源音频，也能承载提取的特征，无需更换解析器。刻意精简的头部避免了对齐填充或可选块，使得用C、Python或MATLAB仅需几行二进制I/O代码即可轻松读取。HTK持久影响力背后的三大优势是：与HTK训练和识别流水线的紧密集成、消除解析器歧义的确定性字节布局，以及在学术语料库中的广泛采用。

开发者: Cambridge University Engineering Department

首次发布: 1993

经常问的问题

为什么要将 SPX 转换为 HTK？

HTK 是隐马尔可夫模型工具包的标准格式，广泛用于语音识别和自然语言处理研究。

HTK 工具包是什么？

HTK（隐马尔可夫模型工具包）是剑桥大学开发的语音识别框架，在全球学术声学研究中广泛使用。

哪些软件需要 HTK 文件？

HTK 工具包本身、Kaldi 以及各类学术语音处理框架均接受 HTK 格式的音频输入。

SPX 语音数据可以用于训练模型吗？

可以——将 SPX 语音录音转换为 HTK 后，可作为语音识别模型的训练或评估数据。

转换是免费的吗？

是的——在 convertio.cloud 上标准使用免费。

特定转换器

MP3 为 HTK

WAV 为 HTK

MP4 为 HTK

FLAC 为 HTK

M4A 为 HTK

OGG 为 HTK

MPG 为 HTK

ASF 为 HTK

AAC 为 HTK

3G2 为 HTK

3GP 为 HTK

AAF 为 HTK

AV1 为 HTK

AVCHD 为 HTK

AVI 为 HTK

CAVS 为 HTK

DIVX 为 HTK

DV 为 HTK

F4V 为 HTK

FLV 为 HTK

HEVC 为 HTK

M2TS 为 HTK

M2V 为 HTK

M4V 为 HTK

MJPEG 为 HTK

MKV 为 HTK

MOD 为 HTK

MOV 为 HTK

MPEG 为 HTK

MPEG-2 为 HTK