「开源数据集」共找到 4969 篇相关文章
阿里开源14B电影级视频模型!实测来了:免费可玩,单次生成时长可达分钟级
昨夜阿里发布14B视频模型Wan2.2 - S2V,仅需一张图片和一段音频,就能生成电影级数字人视频。该模型发布即开源,可在通义万相官网免费体验,单次生成时长可达分钟级。
狂揽20.2k星!还在傻傻的写SQL吗,那你就完了!这款开源项目,让数据分析像聊天一样简单?再见吧SQL
开源项目PandasAI让数据分析像聊天一样简单,由Sinaptik AI团队打造,将ChatGPT级自然语言处理能力注入Pandas。它有对话式分析、智能图表生成等亮点,适用于多场景,还给出使用步骤及与同类工具对比。
Sora2还在5秒打转,字节AI生视频已经4分钟“起飞”
字节和UCLA联合提出Self - Forcing++方法,无需更换模型架构或重收集数据集,就能生成分钟级长视频,最长达4分15秒,高质量且开源,在长、短时长生成上性能领先。
告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25
埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。
SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster
香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码和数据集均已开源,在各项指标上优于SOTA方法。
教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题
上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。
ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架
北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。
SmartSearch:奖励驱动query精炼,让Agent中的RAG会“改错”
现有LLM搜索Agent忽视‘如何提问’致答案易出错。SmartSearch提出‘过程奖励+查询精炼’双机制,让Agent学会‘写不好就改’,代码已开源。经实验,它在六数据集全面领先,各机制缺一不可。
免剪辑直出!AI生成多角色同框对话视频,动态路由精准绑定音频
Bind-Your-Avatar基于扩散Transformer框架,通过细粒度嵌入路由将语音与角色绑定,实现精准音画同步,还引入数据集MTCC和基准测试,实验显示其在身份保真和音画同步上优于现有方法。
ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频
空间音频技术成提升沉浸式体验关键,但现有技术未充分利用360°全景视频空间信息。OmniAudio研究可直接从360°视频生成空间音频,相关代码和数据集已开源,虽有局限但前景好。