AI项目与工具

SpeciesNet

SpeciesNet 是 Google 开发的 AI 模型,用于识别相机陷阱图像中的动物物种,支持超过 2000 种标签分类,涵盖动物、分类群及非生物对象。基于 6500 万张图像训练,具备高效数据处理和跨场景识别能力,适用于野生动物监测、生物多样性研究及生态保护。模型开源,可在 GitHub 获取,支持开发人员部署与优化。

AnyCharV

AnyCharV是一款由多所高校联合研发的角色可控视频生成框架,能够将任意角色图像与目标场景结合,生成高质量视频。它采用两阶段训练策略,确保角色细节的高保真保留,并支持复杂的人-物交互和背景融合。该工具兼容多种文本生成模型,具备良好的泛化能力,适用于影视制作、艺术创作、虚拟现实等多个领域。

字体家

字体家是一款集字体下载、转换与AI生成于一体的综合性平台,主要功能包括基于深度学习技术的个性化字体生成、多种字体生成方式及字型修改服务。其核心优势在于通过AI技术将少量样本字扩展为完整的中文字体库,同时提供便捷的字体管理和版权保障,广泛适用于平面设计、品牌标识、出版物排版等多个领域。

抖音AI分身

抖音AI分身是一款基于豆包大模型算法的AI虚拟分身工具,支持创作者创建与自身风格相似的虚拟形象,用于全天候互动交流。其功能包括AI互动空间、AI群聊、AI私信、AI评论和AI直播,广泛应用于虚拟直播、互动娱乐、内容创作、品牌营销及教育培训等领域,助力创作者高效运营并提升用户体验。

VisionFM

VisionFM是一款专为眼科设计的多模态多任务视觉基础模型,通过大规模预训练支持多种眼科成像模态处理,涵盖疾病筛查、诊断、预后预测、表型细分及全身性生物标志物分析等功能。其在疾病诊断上的表现超越了大部分眼科医生,并具备强大的泛化能力和少样本学习能力。

Momentic

Momentic是一款AI驱动的测试平台,专注于帮助开发者高效创建和管理端到端测试。其核心功能包括低代码交互式编辑器、自动适应UI变化、零代码复杂断言生成以及多环境测试执行能力。Momentic能够显著简化测试流程,加速软件发布周期,并广泛应用于端到端测试、回归测试、UI测试及性能测试等场景。

Proactive Agent

Proactive Agent是一款由清华大学主导开发的主动式AI代理系统,它通过观察环境和用户行为来预测需求并自主发起任务,无需依赖明确指令即可完成操作。主要功能包括环境感知、上下文理解、任务执行及用户互动优化等。此外,该系统采用先进的环境模拟技术和奖励机制进行训练与评估,广泛应用于个人助理、文件管理、生活服务等多个领域。

雪鸮AI

雪鸮AI是一款功能全面的AI图像处理工具,支持大师模型、黑白上色、线稿提取、文字擦除、水印去除、图片放大及老照片修复等多种功能。适用于动漫、游戏、影视等行业,能有效提升设计效率与作品质量,适合设计师、学生及个人创作者使用。

Gemini 2.0

Gemini 2.0 是谷歌推出的原生多模态AI模型,具备快速处理文本、音频和图像的能力,支持多语言输出和实时音视频流输入。通过Agent技术和工具调用,Gemini 2.0 能够自主理解任务并提供解决方案,已在编程、数据分析、游戏等领域展示应用潜力。目前提供免费试用,计划逐步开放更多功能。

EDTalk

EDTalk是一款基于音频驱动的唇部同步模型,支持嘴型、头部姿态及情感表情的独立操控。用户可通过上传图片、音频和参考视频生成具有唇形同步和情感表达的动态人脸视频,广泛应用于教育、影视后期、虚拟现实等领域。其高效解耦机制和轻量化设计使其易于操作且资源友好。