AI项目与工具

MinerU

MinerU是一款开源智能数据提取工具,专注于复杂PDF文档的高效解析与提取。它能够将包含多种内容类型的PDF文档转换为结构化的Markdown格式,支持图像、公式、表格和文本等多种内容处理,保留原始文档结构和格式,支持公式识别与转换成LaTeX格式,自动删除页眉、页脚、脚注和页码等非内容元素,适用于学术、财务、法律等多个领域。

Retake AI

Retake AI是一款基于人工智能的照片编辑与修复工具,支持超分辨率放大、低清人像修复、智能降噪、低光照增强和人像动漫化等功能。所有计算均在本地完成,确保隐私安全。适用于老照片翻新、摄影后期、社交媒体优化及艺术创作等多种场景,提供高质量图像处理解决方案。

Cua

Cua 是一款基于 Apple Silicon 的开源 AI 代理工具,支持在 macOS 上运行高性能的虚拟机,并实现 AI 对桌面应用的操作。其核心功能包括虚拟化、任务自动化、多模型兼容与安全隔离。适用于开发、办公、教育及安全测试等多个场景,提供高效、灵活的 AI 操作体验。

混元图生视频

混元图生视频是腾讯混元推出的开源图生视频模型,支持用户上传图片并输入描述生成5秒短视频,具备对口型、动作驱动和背景音效自动生成等功能。模型适用于多种风格与场景,参数量达130亿,已在腾讯云上线并开源,支持本地部署与定制开发,适用于创意视频、特效制作及动画开发等多个领域。

AI考研宝典

AI考研宝典是一款专为考研学生设计的智能学习工具,集成了AI拍图写作、智能问答、文档总结、时政速记、英语作文美化等多种功能,帮助用户高效学习和备考。其核心功能包括快速解题、知识点梳理、政治学科复习、时政学习和英语作文提升,覆盖了考研学习的多个方面,旨在全面提升考生的学习效率和备考效果。

SynthLight

SynthLight是由耶鲁大学与Adobe Research联合开发的基于扩散模型的人像重照明工具,通过物理渲染引擎生成合成数据并结合多任务训练策略,实现高质量的光照效果生成。它能够根据环境光照图重新渲染人像,生成自然的高光、阴影和漫反射效果,并适用于摄影后期、虚拟场景、游戏开发及广告设计等多个领域,具备良好的泛化能力和实用性。

PicPicAi

PicPicAi是一款集成了多项AI驱动功能的图片编辑工具,支持照片增强、背景移除、物体擦除、老照片修复及黑白照片上色等功能。凭借直观的操作界面和强大的算法支持,它满足了摄影师、社交媒体运营者及内容创作者等群体的专业需求,助力他们快速生成高质量视觉内容。

Chai

Chai是一款AI伴侣应用,提供强大的内容生成能力和独特的交互体验。用户可以与各种AI角色进行聊天,角色具有不同的性格、背景和对话风格。Chai支持用户创建自定义AI角色,个性化推荐适合的AI角色,并提供数千个预设角色。用户可主导剧情走向,探索成人向内容,享受自由度极高的互动体验。同时,Chai支持多语言交流,适用于AI陪伴、角色扮演、语言学习和情感支持等多种场景。

Collaborative Gym

Collaborative Gym(Co-Gym)是一款支持人机协作的开发框架,具备异步交互、任务环境设计和多维评估功能。它通过模拟与真实环境支持开发者进行高效迭代与实际部署,适用于旅行规划、表格分析和文献综述等多种协作任务,提升人机协作效率与质量。

TextHarmony

TextHarmony是一款由华东师范大学与字节跳动联合开发的多模态生成模型,擅长视觉与文本信息的生成与理解。该模型基于Slide-LoRA技术,支持视觉文本生成、编辑、理解及感知等功能,广泛应用于文档分析、场景文本识别、视觉问题回答、图像编辑与增强以及信息检索等领域。通过高质量数据集的构建与多模态预训练,TextHarmony在视觉与语言生成任务中表现出色。