多模态 - 智狐AI导航

Ultravox

Ultravox 是一种多模态大型语言模型（LLM），能够直接处理文本和语音输入，无需额外的语音识别步骤。其核心技术包括多模态投影器，用于将音频数据转换为高维空间表示，显著提升语音理解和处理效率。该模型支持实时语音对话、多语言扩展及领域特定知识的学习，适用于智能客服、虚拟助手、语言学习、实时翻译及教育等领域。

AI项目与工具 2025年06月12日 51 点赞 0 评论 773 浏览

YAYI2

中科闻歌研发的一款新一代开源大语言模型，中文名为“雅意”。该模型包含 Base 和 Chat 版本，参数规模达到 30B，基于 Transformer 架构构建。

Ai平台模型 2025年06月05日 11 点赞 0 评论 774 浏览

Tanka

Tanka是一款具备长期记忆和上下文理解能力的AI通讯工具，旨在提升团队协作效率。它支持智能回复、任务提醒、多模态消息处理，并可集成多种通讯平台。适用于项目管理、客户服务、销售支持及知识管理等多个场景，助力企业实现高效、智能的沟通与信息管理。

AI项目与工具 2025年06月12日 78 点赞 0 评论 774 浏览

MultiFoley

MultiFoley是一款基于多模态控制的音效生成系统，能够根据文本、音频或视频输入生成与视频同步的高质量Foley声音效果。它支持文本驱动和音频驱动的音效生成，同时具备音频扩展和质量控制功能，广泛应用于电影、游戏、动画及虚拟现实等领域，为用户提供灵活且高效的声音设计解决方案。

AI项目与工具 2025年06月12日 78 点赞 0 评论 775 浏览

URM

URM是由阿里妈妈开发的通用推荐模型，结合大语言模型与电商领域知识，提升推荐效果。其采用多模态融合与Sequence-In-Set-Out生成方式，支持多场景、多目标、长尾及发现性推荐。具备高效率、零样本学习能力，适用于工业级推荐系统，已应用于阿里妈妈展示广告场景，优化用户体验与商家投放效果。

AI项目与工具 2025年06月11日 85 点赞 0 评论 777 浏览

紫东太初 – 多模态大模型

“紫东太初”平台展现了中国科学院自动化研究所在人工智能领域的深厚实力。它不仅具备强大的多模态处理能力，还通过自监督学习和跨模态语义关联技术，为广泛的AI应用提供了坚实的模...

Ai平台模型 1970年01月01日 0 点赞 0 评论 777 浏览

DreamFit

DreamFit是由字节跳动与高校联合研发的虚拟试衣框架，专注于轻量级服装图像生成。通过优化文本提示与特征融合技术，提升图像质量与一致性，降低模型复杂度和训练成本。支持姿势控制、多主题服装迁移等功能，适用于虚拟试穿、服装设计、广告制作等多个场景，具备良好的泛化能力和易用性。

AI项目与工具 2025年06月11日 89 点赞 0 评论 779 浏览

Optimus

Optimus-1是一款由哈尔滨工业大学（深圳）和鹏城实验室联合开发的智能体框架，专为开放世界环境中的长期任务设计。它结合结构化知识与多模态经验，通过混合多模态记忆模块（HDKG与AMEP）提升任务规划与执行能力。主要功能包括知识引导规划、经验驱动反思、行动控制及自我进化，已在游戏、虚拟助理、工业自动化等领域得到验证。

AI项目与工具 2025年06月12日 98 点赞 0 评论 780 浏览

Quasar Alpha

Quasar Alpha是一款预发布AI模型，具备100万token的超大上下文窗口，可高效处理长文本和复杂文档。其在代码生成、指令遵循、多模态处理等方面表现出色，支持联网搜索以增强信息准确性。适用于代码开发、长文本分析、创意写作及智能问答等多种场景，目前可通过OpenRouter平台免费使用，存在一定请求限制。

AI项目与工具 2025年06月12日 96 点赞 0 评论 780 浏览

AgiBot Digital World

AgiBot Digital World 是一款基于 NVIDIA Isaac-Sim 的高保真机器人仿真框架，支持多模态大模型驱动的任务与场景自动生成，具备真实感强的视觉与物理模拟能力。其提供多样化专家轨迹生成、域随机化与数据增强功能，助力机器人技能训练与算法优化，并开源了包含多种场景和技能的数据集，适用于工业自动化、服务机器人开发及人工智能研究等领域。

AI项目与工具 2025年06月12日 63 点赞 0 评论 781 浏览

多模态

首页

多模态

列表

默认

浏览次数

发布日期