「通用视频生成模型」共找到 3309 篇相关文章
字节推出X-Streamer,实时口型同步与长程记忆数字人框架
字节推出端到端多模态人类世界建模框架X - Streamer,能从单张人像构建可无限流式生成的数字人,实现音素级口型同步和长程记忆。其核心是“思考者–行动者”双Transformer架构,在两张A100 GPU上可实时运行。
当智能醒于物理世界,英伟达副总裁: 下一个十年属于物理AI!|新智元十周年峰会
在新智元十年峰会上,NVIDIA副总裁赖俊杰揭示公司下一个十年战略核心——物理AI,它是继生成式AI和智能体AI后的下一波浪潮。物理AI与现实物理世界交互,但面临诸多挑战,英伟达为此开源Cosmos世界基础模型。
不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案
作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。
CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影
3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将预训练2D扩散模型用于3D渲染,单步去伪影,效率高、有泛化力,实验效果领先。
LeCun亲自出镜打脸质疑者!憋了20年的AI世界模型,终于爆发了
LeCun亲自出镜介绍V-JEPA 2新进展,目标是开发改变AI与物理世界交互的世界模型。V-JEPA 2基于视频训练,有两阶段训练细节,能用于机器人规划,Meta还发布三个基准测试,后续将研究分层和多模态JEPA模型。
Agent可以自己进化了?!
论文《Automated Design of Agentic Systems》提出让Agent扮演设计师,“元代理”能自动生成新代理设计方案。用编程语言作设计空间,实现“设计自由”。实战中,AI设计的Agent全领域超越人类,还具备知识迁移能力,未来或有自主进化的AI生态。
AI版Office全网首测,键盘鼠标彻底退休!打工人沸腾
昆仑万维天工超级智能体(Skywork Super Agents)结合Deep Research和通用Agent优点,带来AI版office。它有超能Office「六件套」,六大卖点亮点足,具五大自研硬核实力,填补市场空白,有望成智能体赛道黑马。
都标5美元,账单差三成!OpenAI高管:token从来没法直接比价
OpenAI Codex负责人Tibo指出,不同模型对同一段文字切分的token数不同,即便单token价格相同,最终账单也可能差异很大。他还提到,token无统一计量标准,跨厂商和新旧模型计数都难通用,真正重要的是每次成功结果的成本。
10 天 3000 元,一人造出全球 AI 爆款!好莱坞导演抢人、游戏版引爆期待,合作细节首次披露
中国 29 岁中专毕业的 AI 视频创作者 Mx - Shell 用 10 天、3000 元成本做出 AI 短片《丧尸清道夫》爆火,海外 CEO 隔空递 offer。短片将推大银幕版,游戏版也在制作。Yoroll 创始人谈 AI 互动游戏赛道玩法、商业化等问题。
300个AI员工,跑满4000步不崩,Kimi新一代模型K2.6来了
月之暗面开源发布 Kimi K2.6 模型,在通用智能体、代码编写和视觉理解等综合能力上全面跃升。它在多项测试成绩领先,能连续工作13小时,还在全栈开发、多智能体协作等方面有出色表现。