「物理感知」共找到 748 篇相关文章
OpenAI很看好!首个SWE-1模型发布,软件开发或将提速99%
Windsurf发布首个前沿模型SWE-1,目标将软件开发提速99%。它不只能写代码,还能协助软件工程流程。有三个系列模型,SWE-1运行成本低,SWE-1-lite对所有用户开放,SWE-1-mini适用于低延迟场景。
起猛了,机器人开上卡丁车了!
Symbiosis Robotics放出机器人开卡丁车新演示,还推出Direct Perception Control(DPC)。它取消中间运动表示,让模型结合画面、任务和身体反馈直接算关节与手部目标,团队还整理15,010小时具身数据。
1B 参数跑出 2B 性能?面壁 MiniCPM5-1B 用 AI 自进化,提速 AGI 进程
全球AI行业陷入资源消耗战,面壁智能绕开物理瓶颈,提出“AI制造AI”路径。2026年5月25日发布MiniCPM5-1B,有越级性能、极致压缩比和均衡能力,源于“模型、框架、数据”自进化范式。
ChatGPT Images 2.0震撼发布!碾压谷歌Nano Banana,设计真要完了
北京时间凌晨3点,OpenAI发布ChatGPT Images 2.0,是先进模型,能处理复杂视觉任务。它精度控制力高、多语言能力强,风格表达成熟,支持多种宽高比,有现实世界理解能力等,已向相关用户开放,但也有局限性。
OCR 赛道变天了:Datalab 要亲手杀死自己
Datalab推出Chandra模型,指出老一代pipeline OCR已到天花板。它从“切块识别”转向“整页理解”,在布局感知、数学支持、表格表单处理上表现出色,标志OCR从“识别字符”进入“理解文档”阶段。
谷歌用一堆不赚钱的AI小玩意,给科技圈上了一课
谷歌Arts & Culture网站有不少艺术实验项目,从商业看无直接价值,但藏着人文坚守。如Botanic Atlas、Art Palette等,用技术拓展感知文化方式,消解艺术与大众的隔阂。
黄仁勋CES2026最新演讲:三个关键话题,一台“芯片怪兽”
北京时间1月6日,英伟达CEO黄仁勋在CES2026演讲。回顾过去一年开源模型发展,本次围绕系统与基础设施、模型、应用落地三条主线演讲,展示Rubin架构等成果,推动推理型AI发展及应用。
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆
由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。
Sora2甚至可以预测ChatGPT的输出
Sora2表现太卷,能预测ChatGPT输出,模拟交互还能渲染HTML,懂代码也懂物理,能体现玻璃折射现象,还能精准还原游戏支线任务关键要素,或基于LLM训练。