AI项目与工具

SANA 1.5

SANA 1.5是由英伟达联合多所高校研发的高效线性扩散变换器,专用于文本到图像生成任务。其核心优势包括高效的训练扩展、模型深度剪枝、推理时扩展等技术,能够在不同计算预算下灵活调整模型性能。支持多语言输入,并具备开源特性,适用于创意设计、影视制作、教育等多个领域。实验表明,其生成质量接近行业领先水平,同时显著降低计算成本。

Speechelo

Speechelo是一款基于先进AI技术的文本转语音工具,支持超过30种性别和语言的声音选择,用户可通过调整语调、速度和音高来自定义语音效果。它兼容主流视频编辑软件,适用于产品演示、教育培训、营销推广等多种场景,助力高效生成高质量语音内容。

GPTEngineer

GPTEngineer 是一款基于AI技术的开源工具,通过简单的文本提示快速生成网页应用原型。它支持自然语言交互,能够根据用户描述自动生成代码,并具备代码改进、错误检测与修正等功能。此外,GPTEngineer 还支持与 GitHub 同步和一键部署。该工具兼容多种AI模型,适用于快速原型开发、Web应用开发、自动化测试、代码重构及教育等多个领域。

ViLAMP

ViLAMP是由蚂蚁集团与中国人民大学联合开发的视觉语言模型,专为高效处理长视频设计。采用混合精度策略,支持在单张A100 GPU上处理长达3小时的视频,提升处理效率并降低计算成本。具备长视频理解、关键信息提取、多任务处理等功能,适用于教育、监控、直播、影视制作及智能客服等场景。技术上通过差分关键帧选择与特征合并优化性能,实现精准且高效的视频分析。

讯飞译制

讯飞译制是一款基于语音识别与机器翻译技术的智能字幕制作与翻译平台,支持多语言转换与自动字幕生成,提供高精度识别、智能时间码匹配、多格式导出及配音功能,适用于短视频出海、教学视频、广告宣传等多种场景,提升内容传播效率与国际化水平。

FancyVideo

FancyVideo是一款由360公司与中山大学合作开发的AI文生视频模型,采用创新的跨帧文本引导模块(CTGM)。它能够根据文本描述生成连贯且动态丰富的视频内容,支持高分辨率视频输出,并保持时间上的连贯性。作为开源项目,FancyVideo提供了详尽的文档和代码库,便于研究者和开发者深入研究和应用。主要功能包括文本到视频生成、跨帧文本引导、时间信息注入及时间亲和度细化等。

Jammable

Jammable是一款基于AI技术的音乐创作平台,用户可通过选择特定歌手声音或音乐风格,生成个性化的翻唱作品。平台提供快速生成、个性化定制、热门趋势展示及社区互动等功能,适用于音乐创作者、爱好者及教育领域。支持多种应用场景,如个人创作、社交媒体内容制作及创意合作,提升音乐创作效率与多样性。

Radiant Photo

Radiant Photo是一款基于AI技术的照片编辑软件,旨在通过智能算法优化照片色彩和细节。它支持手动与自动操作模式,并可作为独立应用或Photoshop/Lightroom插件使用。软件提供多种预设和工具,涵盖专业摄影、肖像修饰、风景摄影及活动记录等场景,助力用户快速提升照片质量并实现个性化定制。

Amie

Amie是一款AI会议记录工具,能够自动录音并生成会议总结,帮助用户高效管理会议内容和后续工作。它支持多种视频会议平台,如Zoom、Google Meet、Slack Huddle和Microsoft Teams,可自动生成笔记,并允许用户添加私人笔记、自定义标题和关键数字。Amie还提供快速会议总结、AI聊天、多平台集成和智能日程安排等功能,适用于日常任务安排、学习、会议记录与分享以及项目管理等

Kuakua

Kuakua 是一个结合了积极心理学和人工智能技术的平台,旨在提升用户的幸福感和心理健康。它提供多语言支持、心理学资源、AI辅助工具、正念练习和生活方式建议,帮助用户在日常生活中实践积极心理学原则。主要功能包括多语言界面、基于积极心理学的任务和活动、每日学习模块、丰富的心理学资源库以及AI心理健康分析工具。应用场景涵盖个人成长、压力管理、情绪调节、生活习惯改善及专业心理健康支持。