「具身感知」共找到 1282 篇相关文章
CSD7Z020 + CSD9361:从射频到基带,构建完整SDR数据通路
成都华微以CSD7Z020异构SoC搭配CSD9361宽带射频收发器搭建SDR硬件平台,打通从射频到应用层的数据通路,有灵活可编程、高集成度等优势,适用于多种场景。
首个Gemini桌面端曝光,系统级Agent空降PC!
5月20日Google I/O 2026前夕,谷歌提前“放大招”,Gemini桌面端曝光,Mac版先上线。它具备四大核心功能,如系统级Agent操控PC等。全新Gemini 3.2闪现,编程能力惊人,谷歌还更新Workspace应用图标。
确认!DeepSeek多模态AI已经开测
DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。
AI智能体也有「蜘蛛感应」,防御延时骤降至8.3%
传统Agent防御机制易致延时积累,研究者联合推出Spider - Sense智能体防御框架,利用两大核心技术将防御延时从200% + 降至8.3%,在主流数据集和新基准测试中表现优异。
港大nanobot4,000行代码复刻Clawdbot
港大nanobot用4000行代码复刻Clawdbot,解决AI从‘被动回答’到‘主动服务’问题。它有核心架构Agent Loop,三大主动触发机制,模块化设计,还坚持少即是多原则,让AI成自动化助手。
清华&Qwen最新论文实证: VLM 智商与机器人操控能力“零相关”
清华和 Qwen 最新论文《VLM4VLA: Revisiting Vision - Language Models in Vision - Language - Action Models》测试 24 个 VLM 模型,构建极简 VLM4VLA 测试,发现 VLM 通用能力与机器人操控能力‘零相关’,还揭示视觉编码器短板。
智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化
北京智源研究院发布大规模多模态世界模型“悟界·Emu3.5”,它能模拟复杂动态物理世界,揭示“多模态Scaling范式”。该模型继承深化Emu3技术哲学,在多方面有提升,为世界模型领域提供进化路线。
强化学习之父:大语言模型走错了路,不符合「苦涩教训」精神
2024 年图灵奖得主、强化学习创始人之一 Richard Sutton 在播客中批评 LLM 发展方向,认为其无真正智能,违背「苦涩教训」原则,缺乏持续学习能力,仅模仿人类,未理解世界。此观点引发 AI 社区激烈讨论。
Workflow和Agent的本质区别
文章介绍Workflow本质是定义任务及关系,核心是‘依赖关系’;Agent能感知环境、自主决策,核心是‘决策与执行’。二者相辅相成,抽象层次不同,还引出Agentic Workflow概念。
用MoE打造DNA基础模型更强范式!人大实现seq2func全新突破
中国人民大学团队提出SPACE模型,通过引入物种感知编码器和谱系分组增强解码器,革新架构,提升了DNA基础模型性能与泛化能力,在多项测试中表现优于主流模型。