多语言

Narakeet

Narakeet 是一款基于自然语音合成技术的在线工具,支持将文本、文档和字幕转换为高质量音频并同步至视频。提供 100 多种语言和 800 多种声音,支持自动化视频制作和多平台分发,适用于教育培训、市场营销、企业沟通及个人创作等多种用途。

论文智匠—AI论文写作大师

一个专业级AI论文写作助手,可免费生成千字大纲,我们拥有自己微调的开源大模型、论文生成内容质量稳定性高、逻辑清晰、架构严谨,生成文献在知网真实可查,覆盖从本科、专科大学生到成人教育专升本的全品类。

DeepTutor

DeepTutor 是一款基于人工智能的智能辅导系统,支持文本、图表、公式等多种内容的深度理解与解析。用户可上传 PDF 文档并选择不同模式进行提问,系统提供上下文相关的详细解答,并具备视觉内容解读、学习进度跟踪等功能。适用于学生学习、文献分析、知识图谱构建等场景,支持多语言界面,提升学习与研究效率。

33字幕

33字幕是一款集语音识别与文本翻译于一体的AI字幕生成工具,支持多种语言的语音转文字及翻译,可实现实时字幕生成与同步翻译。用户可通过本地AI模型免费运行,显著降低使用成本。该工具具备边识别边生成字幕、台词搜索等功能,广泛应用于视频创作、教育培训、企业会议等领域。

DeepPDF

DeepPDF 是一款基于 AI 的在线 PDF 处理工具,支持文档智能问答、自动摘要生成、多语言翻译、图像与公式解析、术语解释及格式转换等功能。其特点在于保留原文排版、支持多种语言、提供高效的文档管理能力,广泛应用于教育、科研和职场场景,提升文档处理效率与信息理解能力。

PDF2Audio

PDF2Audio 是一款开源工具,支持将 PDF 文档转换为音频内容,适用于播客制作、教育、业务演示等多个场景。其核心功能包括 PDF 转文本、生成播客脚本、文本转语音转换、多语言支持及高级编辑功能。用户可通过自定义选项调整文本生成模型、语音风格等,支持批量处理和多种模板适配,方便用户根据需求生成高质量音频。

Voila

Voila是一款开源的端到端语音大模型,支持实时语音交互与多轮对话,具备高保真、低延迟的音频处理能力。集成语音与语言建模功能,支持百万级预设声音及个性化定制,适用于语音助手、角色扮演、语音翻译等场景。采用多尺度Transformer架构,提升语音理解与生成质量,降低开发成本,提高通用性与灵活性。

SigLIP 2

SigLIP 2 是 Google DeepMind 开发的多语言视觉-语言模型,具有强大的图像与文本对齐能力。它支持多种语言输入,具备零样本分类、图像-文本检索等功能,并通过 Sigmoid 损失函数和自监督学习技术提升训练效率与模型性能。其支持多种分辨率的变体,适用于文档理解、视觉问答及开放词汇任务。该模型基于 Vision Transformer 架构,具备良好的兼容性。

Enconvo

一款为macOS 设计的智能AI启动器,是所有AI功能的入口,也是一位体贴的智能助理,它支持无缝调用AI助手,提供丰富的插件和工具。

Heygem

Heygem是一款由硅基智能推出的开源数字人模型,支持Windows系统。它可通过1秒视频或照片快速生成数字人形象和声音,30秒内完成克隆,60秒合成4K视频。具备多语言支持、100%口型匹配、低配置运行等优势,适用于内容创作、教育、直播、影视及客服等多个领域,提供高效、低成本的数字人解决方案。