「长视频生成」共找到 3155 篇相关文章
图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力
上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。
从 0 到 25 万行:一个 100% AI 编码项目,真正难的不是生成,而是治理
作者分享 Routa 项目用 AI 驱动开发的经验,指出 100% AI 编码项目真正难的是治理。介绍多个工具参与情况,阐述项目长出反馈系统的过程,包括规则入口、上下文收敛、提交前约束及仓库级裁决等。
谁家更新日志那么长啊?Claude Code版本更新引围观,1096次提交一口气上线
Claude Code 从 2.0.76 版本更新到 2.1.0,合入 1096 个 commit,更新日志超长引网友调侃。重点更新包括 Shift+Enter 换行、钩子支持等。后续又有 2.1.1 和 2.1.2 版本修复问题,但有开发者不满更新多且 bug 多。
GAIR 2025 世界模型分论坛:从通用感知到视频、物理世界模型的百家争鸣
第八届GAIR全球人工智能与机器人大会世界模型分论坛上,五位青年学者围绕世界模型展开精彩演讲,话题涵盖通用感知、三维技术等。他们的研究为世界模型领域带来不同启发,目前该领域研究尚处起步阶段,共识未形成。
AI 编程工具在大型企业“遇冷”?网易 CodeWave 升级研发模式,不只关注“代码生成”
近些年,自然语言编程成 AI 编程产品主流。C 端通用 AI coding 工具表现出色,但国内企业级市场 AI 技术渗透率低。网易 CodeWave 专注企业级场景,指出通用工具痛点,提出‘可控的 AI coding’定位并升级能力,未来还将推新开发模式。
全球首个「长肌腱」AI机器人量产!Nature盛赞的中国方案惊艳IROS现场
当特斯拉等巨头还在展示蓝图,星尘智能已量产绳驱AI机器人并获多笔订单。在IROS 2025上,其首发半身机器人和超远程遥操作方案,以「Design for AI」理念获《Nature》认可,展现全栈技术实力。
让图像生成告别 AI 味!清华 + 港中大 + 腾讯混元联手推出SRPO
腾讯混元联合港中大、清华推出SRPO,解决文生图技术痛点。它结合Direct - Align和SRPO,提升图像审美等,训练时间缩至十分钟,在测试中碾压主流方法,不过对冷门风格控制和机制可解释性待提升。
从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!
大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。
语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率
今天凌晨微软研究院开源创新音频模型VibeVoice - 1.5B,有诸多技术突破,如可合成90分钟语音、支持4名发言人、3200倍音频压缩等,还首创双tokenizer协同架构。未来微软还会开源更大参数模型。
一张图0.1秒生成上半身3D化身!清华IDEA新框架入选ICCV 2025
清华和IDEA研究人员提出新框架GUAVA,可0.1秒从单图创建上半身3D化身。它解决了现有方法在ID一致性、效率等方面的局限,实验显示其在渲染质量和效率上优于现有2D和3D方法,代码已开源。