AI项目与工具

artflow

Artflow 是一款利用人工智能技术打造的动画创作工具,用户只需输入文本便能生成包含剧情的动画视频。它支持动画合成、AI 角色生成及视频制作,涵盖多种语言与视觉风格选项,适合教育、营销、娱乐等多个领域应用,帮助用户实现高效且个性化的创意输出。

SpeechGPT 2.0

SpeechGPT 2.0-preview 是复旦大学 OpenMOSS 团队开发的拟人化实时交互系统,基于大量中文语音数据训练,支持低延迟、高自然度的语音与文本交互。具备情感控制、实时打断、多风格语音生成等功能,适用于智能助手、内容创作及无障碍通信等场景,技术上融合了语音-文本联合建模与多阶段训练策略,提升语音表现力与智能化水平。

Browserbase

Browserbase 是一款面向 AI 应用的无头浏览器平台,支持 Playwright、Puppeteer 和 Selenium 兼容,具备快速启动、全球分布和高性能的特点。它主要用于网页自动化测试、数据抓取、AI 集成和网站性能监控,为企业提供高效、灵活的浏览器实例管理解决方案。

OmniParser

OmniParser是一款由微软研究院开发的屏幕解析工具,能够将UI截图转换为结构化数据,通过识别可交互图标和提取功能语义,提升基于大型语言模型的UI代理系统的性能。它支持跨平台应用,无需依赖额外信息,适用于自动化软件测试、虚拟助手、辅助技术等多个领域。

ChildMandarin

ChildMandarin是由智源研究院与南开大学合作开发的3-5岁儿童普通话语音数据集,包含41.25小时高质量语音,覆盖全国22个省市。数据通过家长引导式对话采集,保证自然真实。该数据集支持语音识别、说话人验证和语言研究,适用于儿童语言学习、教育系统、智能玩具和语音助手优化等领域,为儿童语音技术研究提供重要资源。

Context7

Context7 是 Upstash 推出的 AI 编程辅助工具,为 LLM 和 AI 代码编辑器提供最新、版本特定的文档和代码示例。通过解析、丰富、向量化和重新排名等步骤,确保开发者获取准确信息。支持多种开发工具,如 Cursor、Windsurf、Claude Desktop 等,安装配置简单,可显著减少生成错误或过时代码的风险,适合快速更新的框架或小众包使用。

Call Annie

Call Annie是一款基于AI技术的对话工具,通过视频通话形式提供虚拟AI助手Annie,支持实时交流和多种应用场景。主要功能包括实时视频通话、自然语言处理、个性化协助和多平台访问,适用于语言学习、情感陪伴、信息查询、旅行规划、教育辅导及职业发展等场景。

VideoJAM

VideoJAM是Meta开发的视频生成框架,旨在提升视频运动连贯性。通过联合学习外观与运动信息,在训练阶段同时预测像素和运动特征,并在推理阶段利用动态引导机制优化生成结果。该技术具备高度通用性,可适配多种视频生成模型,无需调整训练数据或模型结构,已在多项基准测试中表现优异,适用于影视、游戏、教育等多个领域。

SpatialVLA

SpatialVLA是一款由多机构联合研发的空间具身通用操作模型,具备强大的3D空间理解能力与跨平台泛化控制能力。通过Ego3D位置编码和自适应动作网格技术,实现精准的环境感知与动作生成。支持零样本任务执行与快速微调,适用于工业、物流、医疗等多个领域,推动机器人技术的发展与应用。

H

H-Optimus-0是由法国公司Bioptimus推出的全球最大的开源病理学AI基础模型,拥有11亿参数,基于超过50万张组织病理学切片训练,涵盖多种人体组织。该模型在癌症识别、基因异常检测、组织分类及生存分析等方面表现优异,具备强大的特征提取能力。作为开源工具,H-Optimus-0可促进病理研究与临床应用的协同创新。