# 语音处理
24 个相关产品 · 中文解读 · 按热度排序
Trace – Offline Mac meeting transcripts you can flag mid-call
Mac端离线会议录音转写工具,支持通话中实时标记重点内容,解决远程会议记录效率低、信息遗漏问题,适合远程工作者与团队协作场景
Universal-3.5 Pro
支持原生代码切换、多语言识别和更优说话人分离的语音处理模型,适合开发者和多语言内容创作者
Still Your Words
针对语音转文字错误的AI修复工具,保留原始表达风格,避免过度“美化”导致失真
STT-MCP – local STT for agents
本地化语音转文字(STT)服务,专为AI代理设计,解决云端STT隐私与延迟问题,适合注重数据安全的开发者
Ved AI Voice Assistant
一个基于 AI 的语音助手,专注于提升语音交互体验,可能用于会议记录、任务管理等场景,适合需要高效语音处理的个人或团队。
Vuci – make the spoken word searchable
将语音内容转化为可搜索的文本,让口语化表达(如会议、播客)也能被高效检索和分析,适合内容创作者与知识工作者。
argmax-oss-swift
基于 Apple Silicon 的本地化语音 AI 工具,实现离线语音识别与处理,解决云端语音服务隐私与延迟问题,适合本地 AI 应用开发者。
Trelis Tiron – open-weights multi-speaker meeting transcription
Trelis Tiron 是一个开源多说话人会议转录工具,支持多语言、高精度语音识别与说话人分离,适合会议记录与协作场景
On-device transcriber that's 97% accurate at identifying speakers
一款在设备端运行的语音转录工具,能以97%的准确率识别说话人,适用于隐私敏感场景的会议记录与语音分析
VoiceText AI
VoiceText AI 可将语音消息自动转为清晰文本,提升沟通效率,特别适合远程团队和需要快速记录的用户。
ScribeForge
离线运行的语音转文字软件,完全不依赖云端,支持本地处理音频文件,无使用限制与费用,适合隐私敏感场景,如法律、医疗或企业内部沟通。
Humm – free, private realtime speech-to-text
Humm 是一个免费、私有、实时的语音转文字工具,用户无需上传数据即可本地处理语音,适合注重隐私的开发者、记者与会议记录人员。
Vocal Notes
Vocal Notes 是一款 Mac 平台的私有化语音转文字工具,所有处理在设备本地完成,适合注重隐私的创作者与研究人员
SpeechCompass – speaker direction for captioning group conversations
SpeechCompass 是一个用于多人对话字幕生成的语音方向识别工具,能自动判断说话人位置并标注,适合会议记录、远程协作等场景,提升语音转文字的可读性与上下文理解。
k2-fsa/sherpa-onnx
基于ONNX Runtime的离线语音处理工具,支持语音识别、语音合成、说话人分离、语音增强等,适用于嵌入式设备与移动端。
Pocket Voice: TTS and Voice clone in the browser
一个在浏览器中运行的文本转语音(TTS)和语音克隆工具,用户可直接在前端合成逼真语音并克隆声音,无需后端服务
handy-computer/transcribe.cpp
基于ggml的C++语音转文本推理库,支持16+主流模型,适合本地低延迟语音处理场景。
moonshine-ai/moonshine
超低延迟的语音处理引擎,支持语音转文本、意图识别与文本转语音,专为语音交互AI设计。
debpalash/OmniVoice-Studio
一款本地运行的语音克隆、视频配音、语音转写与有声书制作工具,可替代 ElevenLabs 的开源方案,支持全本地化处理,保障隐私安全。
AuraTranscribe
AuraTranscribe 提供按使用量付费的 Whisper AI 语音转录服务,无订阅制,适合临时或轻量级需求用户。
Production duplex speech model for revenue calls
一个用于营收电话的生产级双向语音模型,专为客服与销售场景优化,支持实时语音交互与语义理解,提升通话效率与转化率。
Lipyn
一款基于AI的语音笔记工具,可自动转录、总结并翻译语音内容,适合需要高效记录与处理语音信息的用户,支持多语言且无需额外配置。
I built remembered checkout for Voice calls
一个用于语音通话中自动记录和回放对话内容的工具,帮助用户在会议或客服通话中快速回顾关键信息,适合需要高效沟通的团队与个人用户
ai-sage/GigaChat3.1-Audio-10B-A1.8B · Hugging Face
基于Hugging Face的GigaChat 3.1音频模型,支持10B参数规模的语音理解与生成,适用于本地部署的多语言语音交互应用,适合开发者与AI研究者快速构建语音AI功能。