多模态 - 智狐AI导航

Cradle

一个通用计算机控制的多模态AI框架，它可以使AI Agent能够像人类一样，能够直接控制键盘和鼠标，实现与任意开源代码或闭源代码软件的交互。

Ai开源项目 2025年06月05日 46 点赞 0 评论 777 浏览

FluxMusic

FluxMusic 是一个开源的音乐生成工具，能够将文本描述转化为音乐。它采用先进的扩散模型和Transformer架构，通过修正流技术提高音乐的自然度和质量。该工具支持多种规模的模型，具备文本到音乐生成、语义理解、多模态融合等功能，适用于音乐创作、影视配乐、游戏音乐生成等多种场景。

AI项目与工具 2025年06月12日 66 点赞 0 评论 777 浏览

千川AI

通过使用自然语言处理（NLP）技术，AI可以理解给定内容的上下文、语气和意图，并生成相关且吸引人的书面输出。

AI写作对话 2025年06月05日 27 点赞 0 评论 776 浏览

OlympicArena

OlympicArena是由多所高校与研究机构联合开发的多学科认知推理基准测试框架，包含11,163道国际奥赛双语题目，覆盖数学、物理、化学、生物、地理、天文学和计算机科学等7大领域。该平台通过答案级与过程级评估，全面衡量AI模型的逻辑与视觉推理能力，支持多模态输入并具备数据泄漏检测机制，适用于AI模型评估、训练优化、教育辅助及科研应用。

AI项目与工具 2025年06月12日 58 点赞 0 评论 775 浏览

逻辑智能

逻辑智能（InsiderX）是一款企业级AI工具平台，支持构建智能化工作流，具备多模态感知和自主决策能力，可处理文本、图像和语音数据，实现业务流程自动化。平台支持私有知识库构建、数据安全保障及内容审查，广泛应用于金融、法律、生物医药等行业，助力企业提升效率和降低成本。

AI项目与工具 2025年06月12日 28 点赞 0 评论 775 浏览

InstructMove

InstructMove是由东京大学与Adobe合作开发的图像编辑模型，基于视频帧对变化学习如何根据指令进行图像操作。它能够执行非刚性编辑、视角调整和元素重排等任务，同时支持精确的局部编辑。该模型采用真实视频数据训练，提升编辑自然性与真实性，适用于影视、广告、设计等多个领域。其技术基于多模态语言模型和扩散模型，结合掩码和ControlNet等控制机制，实现灵活高效的图像编辑。

AI项目与工具 2025年06月12日 21 点赞 0 评论 774 浏览

k1.5

k1.5 是月之暗面推出的多模态思考模型，具备强大的数学、代码、视觉推理能力。在 short-CoT 模式下，性能超越主流模型 550%，在 long-CoT 模式下达到 OpenAI o1 水平。支持文本与图像的联合处理，适用于复杂推理、跨模态分析、教育、科研等领域。通过长上下文扩展和策略优化，提升推理效率与准确性。

AI项目与工具 2025年06月12日 38 点赞 0 评论 774 浏览

Voyage Multimodal

Voyage Multimodal-3 是一款多模态嵌入模型，能够处理文本、图像以及它们的混合数据，无需复杂文档解析即可提取关键视觉特征。它在多模态检索任务中的准确率显著高于现有最佳模型，支持语义搜索和文档理解，适用于法律、金融、医疗等多个领域的复杂文档检索任务。

AI项目与工具 2025年06月12日 27 点赞 0 评论 773 浏览

冒泡鸭AI

一个基于多模态大模型技术的AI聊天机器人和AI智能体平台，冒泡鸭AI内部载有众多由大模型技术驱动的智能对话实体，这些"智能体"不仅致力于为用户解答疑惑、激发创意，还能深度聊天，旨在与用户建立情感纽带。

AI写作对话 2025年06月05日 99 点赞 0 评论 773 浏览

孟子大模型

孟子大模型作为澜舟科技的核心产品之一，展现了公司在认知智能领域的技术实力和创新能力。通过其强大的语言处理和多模态数据处理能力，孟子大模型为不同行业提供了灵活、高效的解...

创作工具 2026年07月28日 0 点赞 0 评论 771 浏览

多模态

首页

多模态

列表

默认

浏览次数

发布日期