视频

VSI

VSI-Bench是一种用于评估多模态大型语言模型(MLLMs)视觉空间智能的基准测试工具,包含超过5000个问题-答案对,覆盖多种真实室内场景视频。其任务类型包括配置型任务、测量估计和时空任务,可全面评估模型的空间认知、理解和记忆能力,并提供标准化的测试集用于模型性能对比。 ---

Veo

Veo是Google DeepMind开发的一款视频生成模型,用户可以通过文本、图像或视频提示来指导其生成所需的视频内容。Veo具备深入的自然语言理解能力,能够准确解析用户的文本提示,生成高质量、高分辨率的视频。其主要功能包括高分辨率视频输出、自然语言处理、风格适应性、创意控制与定制、遮罩编辑功能、参考图像与风格应用、视频片段的剪辑与扩展以及视觉连贯性。Veo技术目前仍处于实验阶段,但已在电影制作

Movie

一款轻松观看电影的网络应用程序,Movie-Web的工作原理是在直观和美观的用户界面中显示来自第三方提供商的视频文件。

SounDraw

SOUNDRAW是一个 A人工智能的音乐生成网站,它可以让所有的创作者自由地定制独特的、无版权的音乐。

Vidalgo

Vidalgo是一款基于人工智能技术的视频创作工具,专为TikTok、YouTube Shorts和Instagram Reels等平台设计。它提供多样化的音乐库、图片资源及视频模板,支持多语言操作,同时具备强大的AI功能,可自动生成引人注目的标题和标签,助力视频内容的高效传播。此外,Vidalgo还拥有无限创意探索和一键视频生成等功能,适用于内容创作者、营销团队及教育机构等多种应用场景。

厘里AI数字人

阿里大文娱技术团队自研的AI数字人,不仅是国内首部文生视频AI系列动画片和电视剧中的应用,也标志着数字人在影视内容创作中的巨大潜力。

ReCamMaster

ReCamMaster 是由浙江大学与快手科技联合开发的视频重渲染框架,支持根据用户指定的相机轨迹生成新视角视频。采用预训练模型与帧维度条件机制,实现视频视角、运动轨迹的灵活调整。具备视频稳定化、超分辨率、外扩等功能,适用于视频创作、后期制作、自动驾驶和虚拟现实等领域,提升视频内容的表现力与质量。

CapsWriter

CapsWriter-Offline是一款基于PC端的离线语音输入与字幕转录工具,支持实时语音转文字功能,具备高准确率和无限时长录音能力。其核心技术依托于深度学习模型,可处理中英文混合语音,并提供热词自定义功能以提升特定术语的识别效果。此工具适用于会议记录、学术讲座、视频字幕生成等多种场景,同时确保用户数据的安全与隐私。 ---

MimicPhoto

MimicPhoto 是一款基于 AI 的图像处理工具,支持面部表情优化、动态视频生成、背景替换及智能补光等功能。用户可轻松调整笑容、眼神等细节,将静态照片转化为生动的动态视频,提升人像质量和视觉表现力,适用于摄影、电商、社交媒体及创意制作等多种场景。