Gemini 2.0 Gemini 2.0 是谷歌推出的原生多模态AI模型,具备快速处理文本、音频和图像的能力,支持多语言输出和实时音视频流输入。通过Agent技术和工具调用,Gemini 2.0 能够自主理解任务并提供解决方案,已在编程、数据分析、游戏等领域展示应用潜力。目前提供免费试用,计划逐步开放更多功能。 AI项目与工具 2025年06月12日 63 点赞 0 评论 482 浏览
ViewCrafter ViewCrafter是一种由北京大学、香港中文大学和腾讯合作开发的先进视频扩散模型。它能够从单一或少量图像中合成高质量的新视图,结合视频扩散模型和基于点的3D表示,通过迭代视图合成策略和相机轨迹规划生成多样化的视图。该模型在多个数据集上展示了强大的泛化能力和性能,适用于实时渲染、沉浸式体验及场景级文本到3D生成等多种应用场景。 AI项目与工具 2025年06月12日 30 点赞 0 评论 483 浏览
TikBuddy TikTok短视频直播数据分析和营销管理平台,提供TikTok热门视频,音乐,排行榜,电商数据,达人监控,视频监控,网红营销等服务。 数据分析 2025年06月05日 28 点赞 0 评论 484 浏览
Buzz Buzz是一款基于OpenAI Whisper模型的离线语音转文字工具,支持实时语音转文字和音频视频文件转录。它具备多语言识别和翻译功能,支持多种格式导出,并能在本地离线操作以保护用户隐私。主要应用于视频字幕制作、采访记录整理、语言学习辅助、会议记录和学术研究等场景。 AI项目与工具 2025年06月12日 10 点赞 0 评论 485 浏览
LongLLaVA LongLLaVA是由香港中文大学(深圳)研究团队开发的多模态大型语言模型,结合Mamba和Transformer模块,利用2D池化技术压缩图像token,大幅提升处理大规模图像数据的效率。该模型在视频理解、高分辨率图像分析及多模态代理任务中表现优异,特别擅长检索、计数和排序任务。其技术亮点包括渐进式训练策略和混合架构优化,支持多种多模态输入处理,广泛应用于视频分析、医学影像诊断、环境监测等领域。 AI项目与工具 2025年06月12日 67 点赞 0 评论 485 浏览
GoEnhance AI 一个基于AI专门用于视频转动漫风格的AI视频增强工具,以实现更高的细节和质量的工具。它利用先进的人工智能技术来分析图像和视频,识别特征和模式,并生成具有更多细节的更高分辨率版本。 Ai视频生成 2025年06月05日 24 点赞 0 评论 485 浏览