「运动之眼」共找到 778 篇相关文章
拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?
多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,一上线便引发关注。今日凌晨,杨植麟等人在 Reddit 开展 AMA 活动,回应 K2 Thinking 一系列问题,还回顾了其在多项测试中的亮眼成绩。
刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%
月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。
实测可灵AI的新视频模型,它生成的动作戏酷到封神。
作者实测可灵2.5新视频模型,它已灰度内测并登上釜山电影节。与可灵2.1对比,可灵2.5在运动和表演能力上大幅提升,还增强了文生视频与理解能力,让创作者有更多创作自由。
拍我AI V5模型发布,AI视频的“不可能三角”被解开了?
拍我AI推出V5模型,一上架就到Artificial Analysis榜单前列。它在多维度升级,维持速度和性价比优势,试图解开AI视频生成“不可能三角”。文章实测其运动、二次元、商业等场景表现,还提及速度与价格优势。
OpenAI一口气建5个算力中心!英伟达喂饱孙正义和甲骨文
英伟达计划给OpenAI一千万美元新投资,OpenAI宣布将和甲骨文及软银合作建五个数据中心,作为奥特曼“星际之门”计划一部分。OpenAI与甲骨文合作熟络,英伟达分批投资,不过其投资金额及资金缺口引疑问。
一手评测Seedance 1.0 pro,字节首次登顶视频大模型竞技场的大杀器来了。
作者在火山引擎发布会现场,认为视频生成模型Seedance 1.0 pro最酷。从多镜头组合、运动质量、情绪、运镜、物理动态效果、风格化六个维度测评,该模型各方面表现出色,无明显短板,已开放给企业用户,今日在豆包App全量上线。
特斯拉世界模拟器亮相ICCV!VP亲自解密端到端自动驾驶技术路线
特斯拉世界模拟器在ICCV亮相,可生成自动驾驶挑战场景,对具身智能也有用。其自动驾驶副总裁Ashok Elluswamy称端到端AI是未来,还揭秘技术细节,特斯拉也在解决端到端面临的难题。业界对端到端路线有VLA和世界模型之争。
CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模
计算机视觉行业从追求识别能力转向关注视觉系统对真实世界的理解。CVPR 2026研究中,多视角、事件视觉、开放集3D生成和相机运动轨迹被引入视觉理解,多篇论文从不同侧面推动视觉系统走向对真实世界的理解。
用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架
张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。