Skip to content
AgentRadar
FunASR

FunASR

已验证

工业级开源语音识别:170 倍实时、50+ 语言、说话人分离与情感检测

语音智能体 开源

发布时间

2023

国家/地区

中国

API

可用

自托管

GitHub Stars

18,043

最近更新

2026-06

关于 FunASR

FunASR 是阿里达摩院 ModelScope 团队开发的工业级开源语音识别工具包。它为对准确性、速度和语言覆盖有要求的语音生产工作负载而建:该工具包提供高达 170 倍实时转写速度,支持 50 多种语言(中文表现尤为出色),并远超纯文本——支持说话人分离(分辨谁在何时说话)、情感识别、标点恢复以及用于实时音频的流式能力。 FunASR 与典型 ASR 演示的不同之处在于其端到端的生产导向。它提供可直接部署的预训练模型,提供与 OpenAI 兼容的 API 以便无缝接入现有技术栈,并提供本地和云端两种部署路径。这使其适用于真实应用——呼叫中心转写、会议字幕、语音助手、媒体字幕和合规监控——而非仅用于实验。该工具包是更广泛的 ModelScope 模型生态的一部分,可访问一个持续改进的语音模型库。 FunASR 已吸引了庞大的开发者社区(数万 GitHub stars),尤其是在构建中文语音产品、需要专有语音 API 的开源可自托管替代方案的团队中。由于模型和运行时都是开放的,团队可以在自己的基础设施上运行一切,以实现数据主权和可预测的成本。 它面向需要准确、快速、多语言且可自托管并集成到产品中的语音识别的开发者和工程团队——尤其是中文需求繁重的场景。

总评

面向生产的开源语音识别引擎,尤以中文见长。FunASR 的速度、语言覆盖和超越文本的功能(分离、情感)使其成为商业 ASR 的强力可自托管替代方案——在中文准确性至关重要的场景中最强。

功能特性

高达 170 倍实时转写
50+ 语言(中文出色)
说话人分离
情感识别
流式/实时音频
兼容 OpenAI 的 API
标点恢复

详细评分

易用性
7.4
性价比
8.4
功能
8.2
技术支持
7.4
性能
8.2
综合评分
8.0 /10

优缺点

优点

  • 工业级准确性和速度(高达 170 倍实时)
  • 出色的中文支持及 50+ 语言
  • 超越文本——分离、情感、标点
  • 开源且完全可自托管,保障数据主权
  • 兼容 OpenAI 的 API 无缝接入现有技术栈

缺点

  • 自托管需要技术配置和足够的硬件
  • 文档不如商业语音 API 精致
  • 最大优势在于中文场景

应用场景

呼叫中心与会议转写实时字幕与流式音频语音助手输入流水线媒体字幕合规与监控转写

适合谁使用?

需要准确、快速、多语言且可自托管的语音识别的开发者和工程团队,尤其是中文工作负载繁重的场景

#语音识别#ASR#开源#中文#自托管#流式#ModelScope

常见问题

FunASR 是什么?

FunASR 是阿里达摩院 ModelScope 团队的开源工业级语音识别工具包。它以高达 170 倍实时速度跨 50+ 语言转写音频,支持说话人分离、情感识别和流式识别。

FunASR 是免费的吗?

是的。FunASR 免费开源,你可以在自己的基础设施上自托管。你只需为运行它所用的计算硬件或云端 GPU 付费。

FunASR 与 Whisper 或商业语音 API 相比如何?

FunASR 面向生产,中文表现出色,具备分离、情感检测和兼容 OpenAI 的 API。Whisper 是强大的通用模型,但生产功能较轻。商业 API 更精致但封闭且按使用计费。

FunASR 能在我自己的服务器上运行吗?

可以。FunASR 完全可自托管。预训练模型和运行时都是开放的,因此你可以在自己的基础设施上运行整个语音流水线,实现数据主权和可预测的成本。

相关智能体

热门替代方案

与这些相似工具进行比较

链接与资源

AR 审阅者 AgentRadar · 审阅日期 · 我们的评分方式

档案由 AI 辅助、基于公开信息生成——未经独立手动测试。