「关节动作」共找到 289 篇相关文章
清华&Qwen最新论文实证: VLM 智商与机器人操控能力“零相关”
清华和 Qwen 最新论文《VLM4VLA: Revisiting Vision - Language Models in Vision - Language - Action Models》测试 24 个 VLM 模型,构建极简 VLM4VLA 测试,发现 VLM 通用能力与机器人操控能力‘零相关’,还揭示视觉编码器短板。
Anthropic这两天真没闲着:上线网页版Claude Code,还让Claude搞科研
Anthropic推出Claude Code网页版,无需本地安装命令行工具,还提供Claude iOS应用预览版。其有并行处理多任务等亮点。此外,还发布Claude生命科学版,搭载Claude Sonnet 4.5模型,能助力科研。
OpenAI 即将发布 Agent Builder,类似扣子、Dify、n8n
据外网爆料,OpenAI 即将于 10 月 6 日 DevDay 发布 Agent Builder,它是工作流自动化工具,有拖拽式画布,能构建 Agent 工作流。对用 OpenAI API 的开发者等是福音,将延伸其平台能力。
英伟达400亿押注开源,边卖铲子边挖矿
英伟达被曝砸60亿美元押注开源模型,向Poolside投资10亿美元并买其‘模型工厂’技术非独家使用权。它主张闭源开源两手抓,此前已发布系列开源模型、组建联盟,开源布局广泛。
VLA别再「走神」:即插即用提升视觉泛化,相对Pi0.5提升18%
至简动力、北大、港中文团队发现VLA模型深层动作预测对关键视觉区域依赖下降,提出DeepVision - VLA框架,在仿真和真实任务中效果显著,能有效提升视觉泛化能力。
谷歌也要「AI抖音」了!新Veo 3.1原生支持竖屏,4K分辨率高画质
谷歌Veo 3.1升级,全方位提升视频生成质量,新增竖屏和4K两大特性。它还提升创意、一致性和元素融合能力。谷歌借此进军AI短视频,结合自身优势推动“AI视频竖屏化”趋势。
刚刚!AI 圈顶流 Karpathy 三连击:开源、泼冷水、AI 教育~
10月,AI圈顶流Andrej Karpathy有三连动作:开源nanochat项目,100美元可复刻ChatGPT;发表AGI十年论,给行业泼冷水;推进Eureka教育项目,重构AI教育范式。
宇树:开源机器人世界大模型!
宇树开源世界模型 - 动作架构UnifoLM - WMA - 0,它属UnifoLM系列,适配多机器人本体。真机部署表现出色,预测与实际操作吻合。官方介绍训练策略,代码开源后GitHub获100 + Star。
刚刚,OpenAI任命新印裔CTO!11亿美金连公司打包收购,接管ChatGPT产品核心
OpenAI斥资11亿美金收购实验平台Statsig,其CEO Vijaye Raji成应用部门新CTO,将负责ChatGPT等产品工程。同时启动「OpenAI for Science」项目,打造AI驱动的科学发现平台。
一个任务50次调用,成本狂砍90%?Manus首次公开上下文工程秘诀,一堆反复重写换来的教训
Manus项目团队分享上下文工程秘诀。他们押注于此,使产品发布改进更快。还阐述围绕KV缓存设计、掩码非移除工具、用文件系统作上下文等原则,助构建AI Agent者少走弯路。