「自回归动作世界模型」共找到 1401 篇相关文章
豆包上可以体验 Seedance 2.0 了,我已经试了一下。
Seedance 2.0是字节自研视频生成模型,已接入豆包App、电脑端和网页版。支持文生视频、图生视频、分身视频等,动作自然、镜头连贯,生成质量高,还解决了创作者出镜难题,操作也简单。
AI 互动游戏的 GPT 时刻到了!谷歌Genie 3首测!太牛了!
谷歌去年发布世界模型Genie 3,支持实时生成可交互视频内容,因成本高未开放。现美国18岁以上Ultra用户可试玩,其操控延迟低、画面清晰、物理交互真实,还介绍了操作流程等。
十万美元的机械狗,正在“排泄”你的肖像!
迈阿密巴塞尔艺术展上,单价十万美元的《普通动物》作品由三只戴扎克伯格、马斯克和安迪·沃霍尔面具的机械狗组成,内置摄像头,能捕捉画面经AI生成图像后“排泄”出实体作品,迅速售罄,引发不同看法。
原生3D-VAEs,1536³三维分辨率,清华与微软TRELLIS 2开启3D全能生成新纪元
清华与微软团队推出TRELLIS 2系统,用全新O-Voxel表示法,1分钟生成1536³分辨率3D资产。它解决拓扑灵活性与存储效率矛盾,结合SC-VAE和流匹配模型,在多方面超越现有模型,还能适应不同场景。
AI修真的一年:学者们怎么看“真智能”?|甲子光年
甲子光年在年终盛典对话三位学者,探讨AI“真假智能”。学者们提及强化学习、推理、多模态等技术突破,分析研究路径,还谈选择标准与未来期待,指出AI是工程实践命题,真与假关乎信念选择。
地平线首曝BPU「黎曼」架构,用数学流形重构AI计算
2025 年 12 月 8 日深圳举办的地平线技术生态大会上,地平线首曝 BPU「黎曼」架构,用数学流形重构 AI 计算。还发布第四代编译器,推出 HSD Together 模式,开源具身智能模型,欲构建物理 AI 世界底层生态。
北大、字节、中科院自动化研究所等提出图像并行生成新范式
北大、字节等团队发现多模态模型先思考后作画会降低图像语义保真度,因自回归架构有误差传播问题。为此提出并行多模态扩散框架MMaDA - Parallel,构建ParaBench基准,多项优化后在测试中击败Bagel。
宇宙尺度压缩:Scaling Law的边界,柏拉图表征收敛于物质和信息交汇,解决P与NP问题,Simulation假说……
超对称公司在BigBang - Proton实现跨尺度跨结构科学多任务学习,提出宇宙尺度压缩构想。文章论证其科学基础、工程可行性与意义,探讨Scaling Law边界,还给出宇宙尺度压缩计划和相关假设。
2M大小模型定义表格理解极限,清华大学崔鹏团队开源LimiX-2M
大语言模型在结构化表格数据处理上表现不佳,清华大学崔鹏团队开源的 LimiX-2M 模型,仅 2M 参数,却能同时支持分类、回归等任务,性能超越经典模型,且训练、运行成本低,科研友好。
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。