世界模型生成」共找到 8925 篇相关文章

推荐文章7

2025.7.4上午 | 视觉智能驱动的多模态对齐与推理的近期系列工作分享 - 复旦博士生王思尹

本次分享由复旦博士生王思尹围绕‘视觉智能驱动的多模态对齐与推理’展开,介绍多模态大模型探索研究,涉及跨模态组合语义理解、视觉参与推理及基于视觉建模世界完成行动等内容。

深度学习自然语言处理
新闻资讯7

yann lecun(杨立昆)新公司AMI融资10亿美元,要做LLM的替代品

Yann LeCun离开Meta后与Alexandre LeBrun创立AMI Labs,获10.3亿美元融资。他们认为LLM有幻觉问题,AMI Labs用JEPA架构构建‘世界模型’,代码和论文将开源,不过短期内无产品和收入。

AI工程化
产品应用8

谷歌nano banana正式上线:单图成本不到3毛钱,比OpenAI便宜95%

昨晚谷歌图像生成与编辑模型nano banana上线,正式名gemini - 2.5 - flash - image - preview。它有强大能力,成本低,有多种玩法,上线后测试火爆,在多个榜单成绩优异。

机器之心
产品应用8

英伟达再破世界纪录,每秒1000 token!刚刚,全球最快Llama 4诞生

英伟达用Blackwell创下AI推理新纪录,单节点8颗GPU实现Llama 4 Maverick模型每秒单用户生成1000个token。这得益于技术组合拳,如用TensorRT - LLM优化、应用FP8格式等,满足了低延迟需求。

新智元
新闻资讯8

苏妈和李飞飞炸场CES!AMD AI全栈野心显露:从云端到个人PC,AI芯片性能四年要飙1000倍

今年 CES 上 AMD 专场演讲亮点多。苏姿丰称未来五年50亿人每天用 AI;李飞飞和她探讨空间智能与世界模型;Helios 平台受关注,MI455 GPU 解决内存墙;Ryzen AI 推动 AI 下放到本地。

AI前线
开源动态8

比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA

兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。

量子位
新闻资讯7

谷歌「推理之王」也跑路Meta了,当年还是李飞飞挖来的

谷歌「离职潮」含金量提升,「推理之王」周登勇跳槽Meta。此前Noam Shazeer、John Jumper等也相继离开。谷歌全力「武装」AI Coding突击小队,重构Gemini训练方式,与原世界模型AGI路线冲突。

量子位
新闻资讯7

The Batch: 844 | AI 天气预测加速推进

美国国家飓风中心与 Google 的 Weather Lab 合作,利用新模型预测风暴。该模型能比传统方法更准确预测风暴形成、路径和强度,最长提前 15 天,测试表现优于 Google 之前的 GenCast 模型和 ENS 模型

DeeplearningAI
算法论文8

让机器人学会“预判接触”:它石智航牵头四大顶尖机构发布TacForeSight,破解精细操作难题

它石智航联合四大顶尖机构发布论文“TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation”,提出力条件触觉世界模型,让机器人能提前预判接触变化,在精细操作领域取得关键进展。

量子位
产品应用7

Current Robotics 发布 Curr-0:以 Single Policy 实现全身灵巧操作

Current Robotics发布Curr - 0,解决人形机器人移动与操作分离困境。它用Single Policy统一训练,基于HumanEx采集数据,还构建多物理模态交互世界模型,是全栈具身智能基础设施成果。

AI科技评论