图像处理

MagicMirror

MagicMirror是一款基于深度学习的开源AI工具,提供面部替换、发型调整和穿搭模拟功能。其特点包括易用性、硬件兼容性、隐私保护及轻量化设计,支持离线运行,适用于个人娱乐、创意设计及虚拟角色扮演等场景。

Wavy

Wavy是一款利用AI技术的照片编辑工具,可将普通照片转换为具有艺术风格的作品。它提供多种功能,包括AI艺术生成、图像放大、照片优化以及对象移除等,适用于个人摄影、社交媒体内容创作、艺术设计等多个场景,帮助用户实现创意表达与个性化展示。

Kerqu.Ai

Kerqu.Ai是一款基于AIGC技术的跨境电商AI工具,提供多语言文案生成、图像编辑、数据分析等功能,帮助用户快速生成吸引人的产品描述和专业图片,优化电商平台展示效果,助力品牌全球化发展。

万彩商图

万彩商图是一款基于AI技术的图像处理工具,为电商行业提供商品背景替换、模特图生成、批量抠图、高清修复及无损放大等功能。它能够显著提升图片生产效率,优化电商视觉体验,适用于商品展示、广告制作及社交媒体推广等多个场景。

NVILA

NVILA是一款由NVIDIA开发的视觉语言模型,通过“扩展-压缩”策略优化处理高分辨率图像和长视频,兼具效率与准确性。它在图像和视频基准测试中表现优异,支持时间定位、机器人导航和医疗成像等应用场景,并通过参数高效微调和量化技术提升模型性能。未来将在GitHub和HuggingFace平台上开源。

PaliGemma 2

PaliGemma 2是一款由Google DeepMind研发的视觉语言模型(VLM),结合了SigLIP-So400m视觉编码器与Gemma 2语言模型,支持多种分辨率的图像处理。该模型具备强大的知识迁移能力和出色的学术任务表现,在OCR、音乐乐谱识别以及医学图像报告生成等方面实现了技术突破。它能够处理多模态任务,包括图像字幕生成、视觉推理等,并支持量化和CPU推理以提高计算效率。

Radiant Photo

Radiant Photo是一款基于AI技术的照片编辑软件,旨在通过智能算法优化照片色彩和细节。它支持手动与自动操作模式,并可作为独立应用或Photoshop/Lightroom插件使用。软件提供多种预设和工具,涵盖专业摄影、肖像修饰、风景摄影及活动记录等场景,助力用户快速提升照片质量并实现个性化定制。

InfiMM

InfiMM-WebMath-40B是由字节跳动与中国科学院联合推出的大规模多模态数据集,涵盖大量数学和科学内容,包括文本、公式、符号及图像。该数据集通过筛选、清洗和标注优化,可显著提升多模态模型的数学推理能力。它适用于数学题库生成、学习工具开发、论文理解及科学研究等多个应用场景。 ---

LEOPARD

LEOPARD是一款由腾讯AI Lab开发的视觉语言模型,专为处理包含大量文本的多图像任务而设计。它通过自适应高分辨率多图像编码模块和大规模多模态指令调优数据集,实现对复杂视觉语言任务的高效处理,包括跨图像推理、高分辨率图像处理及动态视觉序列长度优化。LEOPARD在自动化文档理解、教育、商业智能等领域具有广泛应用潜力。

FLUX Tools

FLUX Tools是一套由黑森林实验室开发的增强型文本到图像模型工具,包含FLUX.1 Fill、FLUX.1 Depth、FLUX.1 Canny和FLUX.1 Redux四个模块,能够通过文本描述和掩码对图像进行精确编辑和扩展,支持图像修复、扩展、结构化引导、混合与再创作等功能。工具基于深度学习和神经网络技术,结合结构引导和文本到图像转换功能,适用于多种应用场景,包括数字艺术创作、游戏开发、