多语言

音独Ondoku

音独Ondoku,一个在线文字转语音合成的网站,支持各国语言的配音,支持语音和语速调节。

EmotiVoice

EmotiVoice是网易有道推出的开源文本到语音系统,支持中英文及2000+音色,能根据提示生成带情感的语音。具备情感合成、语音克隆、多语言支持等功能,提供Web界面和API接口,适用于有声读物、智能助手、教育、客服等场景,技术上支持高效部署与模型微调。

FalcoCut

一款功能非常实用的多语言本地化AI视频生成与编辑工具,支持视频翻译、换脸、音频编辑、唇同步、数字人生成等功能。

FireRedASR

FireRedASR是小红书推出的工业级自动语音识别(ASR)模型系列,支持普通话、中文方言和英语,具备高精度和高效推理能力。其包含FireRedASR-LLM和FireRedASR-AED两个版本,分别聚焦于极致精度和计算效率。模型在多个场景如智能助手、视频字幕生成、歌词识别和语音输入中表现出色,且已开源,推动语音识别技术的发展。

泥巴影院

一个专为海外华人提供的在线视频平台,用户可以在此平台上免费观看最新的电影、电视剧、综艺、动漫等内容。泥巴影院即点即播,无广告无VIP,用户体验流畅。

谛韵DiffRhythm

DiffRhythm(谛韵)是一款由西北工业大学与香港中文大学(深圳)联合开发的端到端音乐生成工具,基于潜扩散模型技术,能在10秒内生成包含人声和伴奏的完整歌曲。用户只需提供歌词和风格提示,即可快速获得高质量音乐作品。其支持多语言输入,具备歌词对齐、风格定制、非自回归生成等技术优势,广泛应用于音乐创作、影视配乐、教育及个人创作等领域。

Pixtral Large

Pixtral Large是一款由Mistral AI开源的超大规模多模态模型,具备1240亿参数,支持文本、图像和图表的理解与生成。它拥有128K的上下文窗口,能在多语言环境中处理复杂文档和多图像场景,广泛应用于教育、医疗、客服和内容审核等领域。

Eleven Labs

Eleven Labs的长格式语音生成平台使用人工智能为创作者和出版商创造自然而引人注目的声音。

天书AI

天书AI是一款面向企业的AI智能助手集成平台,基于深度学习与自然语言处理技术,支持自定义知识库和精准场景训练。其功能涵盖自主学习、角色个性化及服务定制化,适用于客户服务、企业内部知识管理、教育培训等多个场景,帮助企业实现高效智能化运营。