AI项目与工具

DiffEditor

DiffEditor是由北京大学深圳研究生院与腾讯PCG联合研发的图像编辑工具,基于扩散模型,结合图像与文本提示,支持细粒度对象移动、尺寸调整、内容拖动及跨图像编辑。采用区域随机微分方程(Regional SDE)和时间旅行策略,提升编辑准确性和灵活性。无需额外训练即可实现高效图像处理,适用于创意设计、人像修复和风景优化等场景。

海豚AI配音

海豚AI配音是一款支持多语言、多音色的文本转语音工具,提供超过500种真人音色和1000多种二次元音色,适用于有声书、自媒体、教育、动漫及广告等领域。支持多人配音、声音克隆、变声等功能,操作简便,适合各类内容创作者提升作品质量。

LatentLM

LatentLM是一款由微软与清华大学合作开发的多模态生成模型,能够统一处理文本、图像、音频等多种数据类型。它基于变分自编码器(VAE)和因果Transformer架构,支持自回归生成与跨模态信息共享,特别擅长图像生成、多模态语言模型及文本到语音合成等任务,其提出的σ-VAE进一步提升了模型的鲁棒性。

Mona Land

Mona Land是一款基于AI技术的角色扮演互动平台,提供高度拟真的虚拟角色定制服务,用户可设计角色外观、性格及思维模式,并与之进行深入对话和冒险。平台支持多平台访问,拥有丰富的角色类型和沉浸式故事体验,适用于角色扮演爱好者、创意表达者及社交互动需求者。

BookAI

BookAI是一款结合AI技术的创新性交互平台,通过聊天机器人形式实现用户与书籍的互动交流。其主要功能包括多语言支持、智能对话、内容分析、个性化推荐、社交互动及阅读进度追踪等。BookAI不仅适用于个人阅读,还可用于语言学习、教育领域、图书馆服务以及企业培训等多个场景,为用户提供丰富且高效的阅读体验。

Lingua

Lingua是Meta AI推出的轻量级代码库,专注于大规模语言模型的训练与推理。它基于PyTorch框架,具有模块化设计、分布式训练支持以及灵活的自定义能力,适用于学术研究、工业部署及模型优化等多个领域。Lingua支持端到端训练、性能优化、多GPU协作,并提供丰富的工具来管理和保存模型。

TripoSG

TripoSG 是一种基于大规模修正流模型的高保真 3D 形状生成技术,能够从单张图像生成高质量的 3D 网格模型。其核心优势包括高分辨率重建、语义一致性、强泛化能力和稳健的性能。通过混合监督训练策略和高质量数据集,TripoSG 实现了更精准的几何表示与细节还原。该技术适用于工业设计、VR/AR、自动驾驶、教育及游戏开发等多个领域。

DiffBrush

DiffBrush是由多所高校与研究机构联合开发的图像生成与编辑工具,支持用户通过手绘草图直接控制图像生成过程。其核心技术包括颜色引导、实例与语义控制、潜在空间再生等,兼容多种主流T2I模型,如Stable Diffusion、SDXL等,并支持LoRA风格调整。该工具简化了AI绘画流程,提升了图像生成的精度与灵活性,适用于创意绘画、图像编辑、教育、游戏设计等多个领域。

Career Dreamer

Career Dreamer 是谷歌推出的实验性 AI 工具,帮助用户探索职业路径并实现职业转型。通过输入工作经验、技能和兴趣,生成“职业身份声明”,推荐匹配职业方向,并提供职位信息、技能需求及培训资源。还可协助撰写简历和求职信,适用于职业探索、求职准备及技能提升等场景。无需登录即可使用,已在部分区域上线。

OmniThink.AI

OmniThink.AI是一款面向零售和消费品行业的AI平台,整合预测性与生成性AI技术,助力企业加速产品设计、营销及供应链管理。平台支持自然语言解释、全球数据模型、多系统集成,并提供可持续性评估与个性化推荐功能,提升运营效率与市场响应速度。