「自回归动作世界模型」共找到 1401 篇相关文章
SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案
文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机器人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。
印度,拿什么实现自己的芯片梦?
印度近期在集成电路产业频有消息,两个半导体项目因资金问题搁浅。印度政府野心大,出台多项扶持政策,但其在芯片制造方面基础薄弱,实现半导体蓝图面临资金、人才、基建、营商环境等多重挑战。
Gemini:约束
本文围绕“约束”展开探讨,通过对话形式深入剖析其内涵。指出约束不仅是限制,更是塑造和成全;它存在于多个层面,影响着人、组织和事物的发展。还通过公司和人的具体案例,构建了分析约束的框架。
Meta全开源HumanCLAW:基础模型正进入具身智能的决策层
过去基础模型主要理解和描述物理世界,如今开始进入机器人控制栈。Meta等提出HumanCLAW,将高层行动与低层运动控制分开。评测显示当前模型在行动决策上存在不足,未来可从多方向推进研究。
全球首个!10万小时人类数据全开源,Hugging Face罕见站台
上周Dyna Robotics公司用超100万小时人类第一视角视频训练DYNA - 2模型,发现物理AI有Scaling Law。8月20日光轮智能宣布10万小时全模态人类行为数据EgoSuite - Open100K开源,与Hugging Face联合发布。
押注Agent,林俊旸带着新公司杀回来了
前阿里Qwen负责人林俊旸创办Pragmatik Labs/语用科技,研究跨数字与物理世界的下一代agent。红杉中国、高榕创投领投,腾讯等跟投。其目标是用agent实现终极生产力,有独特技术底色与愿景。
AI 能力越来越强,那么它生成的代码,人类还需要去理解吗?
《代码整洁之道》作者罗伯特·C·马丁不逐行看 Agent 代码,设好测试框架通过就行。Notion 工程师 Geoffrey Litt 在会议探讨人类是否需理解代码,多数人认为需要,Litt 分享理解代码方法。
Claude Opus 5刚发布就被玩疯了~
Claude Opus 5刚发布,社区就玩疯了。Anthropic给它定位接近Fable 5,价格仅一半。网友让它与Fable 5、GPT 5.6等做物理场景测试,Opus 5表现不错,但也有不足。官方还给出了其Prompt指南。
70万辆车同步升级,背后那套系统藏了六年
超70万蔚来和乐道车主收到最新版世界模型推送更新。蔚来用一套代码覆盖多品牌、多平台、多芯片、多传感器车型,其技术体系复杂,从2020年起搭建,六年未改底层逻辑,如今效果显现。
腾讯频繁发大招,这次轮到企业微信了
腾讯近期动作频繁,企业微信迎来大版本更新,有智能助理大圆、记录面聊等功能,还升级了智能“服务总结”和智能文档。这些功能实用性强,解决社群管理痛点,AI 能无缝融入工作流。