RealtimeSTT RealtimeSTT是一款开源的实时语音转文本库,具备高精度语音活动检测、GPU加速的实时转录能力以及语音唤醒功能。支持多语言识别,适用于语音助手、会议记录、实时字幕等场景,提供灵活的音频输入与预处理机制,便于开发者快速集成和扩展。 AI项目与工具 2025年06月12日 97 点赞 0 评论 467 浏览
OSUM OSUM是一款由西北工业大学研发的开源语音理解模型,结合Whisper编码器与Qwen2 LLM,支持语音识别、情感分析、说话者性别分类等多种任务。采用“ASR+X”多任务训练策略,提升模型泛化能力和稳定性。基于约5万小时语音数据训练,性能优异,适用于智能客服、教育、心理健康监测等多个领域。 AI项目与工具 2025年06月12日 46 点赞 0 评论 413 浏览
Scribe Scribe 是由 ElevenLabs 推出的高精度语音转文本模型,支持 99 种语言,具备多说话者区分、非语言事件检测和单词级时间戳功能。输出结构化的 JSON 数据,适用于会议记录、字幕生成、内容创作等多种场景,广泛应用于教育、客服及媒体领域。 AI项目与工具 2025年06月12日 86 点赞 0 评论 304 浏览
Oliva Oliva 是一款基于语音驱动的 RAG 助手,结合 Langchain 和 Qdrant 向量数据库,实现语音指令到结构化数据的实时响应。支持多智能体协作、语义搜索与灵活知识库集成,适用于企业知识库、智能客服、智能家居等多种场景。具备语音识别、实时通信和自然语言处理能力,提升信息获取与交互效率。 AI项目与工具 2025年06月12日 57 点赞 0 评论 476 浏览
SignGemma SignGemma是由谷歌DeepMind团队开发的全球最强大的手语翻译AI模型,专注于将美国手语(ASL)实时翻译成英语文本。通过多模态训练方法,结合视觉和文本数据,实现高准确率和低延迟的翻译,响应时间低于0.5秒。支持端侧部署,保护用户隐私,适用于教育、医疗和公共服务等场景。 AI项目与工具 2025年06月11日 24 点赞 0 评论 292 浏览
Sonix 一个自动转录、翻译和字幕平台,快速、准确、实惠。它可以将音频和视频转换为文本,利用其先进的自动翻译引擎在几分钟内翻译文本,并创建全自动字幕 Ai语音工具 1970年01月01日 0 点赞 0 评论 408 浏览
AudioNotes.ai AudioNotes.ai 是一个高效的语音转文本服务,特别适合需要快速记录和整理语音信息的用户。它的自动语音识别和文本改善功能,加上灵活的摘要选项,使用户能够轻松地将语音内容转换... 排版编辑 1970年01月01日 0 点赞 0 评论 114 浏览
Instructly Instructly 是一个高效的人工智能 (AI) 内容创作平台,旨在帮助用户快速、轻松且经济地创作出高质量的内容。 GPTs应用 1970年01月01日 0 点赞 0 评论 3 浏览