语音识别
4 条- 01六层更少:面向Whisper模型的无标签恢复编码器剪枝
提出无需标注的编码器剪枝方法,成功将Whisper编码器压缩6层,保持语音识别精度。
- 02Grok Voice Transcribe 2.0
xAI 推出 Grok 语音转录 2.0,提升多语种实时语音识别准确率与低延迟性能。
- 03Canto:面向真实世界的语音模型
发布端到端语音模型Canto,专为嘈杂环境、口音多样等现实场景优化,提升鲁棒性。
- 04Show HN:Nari Qwen3-TTS 和 Qwen3-ASR —— 高精度、低延迟、低成本
开源语音合成与识别模型Qwen3-TTS/ASR发布,强调高准确率与低推理成本