「空间感知流矫正」共找到 776 篇相关文章
VLA大模型做长任务总断片?同济KC-VLA用关键帧链给治好了
VLA大模型记性是短板,处理非马尔可夫任务常束手无策。同济大学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了长时序记忆依赖基准测试,实验显示其性能优越。
刚刚,微软推出AI浏览器,上网从此不一样了
微软Edge浏览器推出“Copilot模式”,将其变成AI智能体,有跨标签页情境感知等功能。该模式限时免费,支持语音控制等,还将增加新功能。微软此举或引发浏览器大战,未来浏览器AI模式可能收费。
快9倍还更清晰?Direct3D-S2一键解锁高效3D生成
在高分辨率三维形状生成中,传统方式有计算与内存瓶颈。南京大学提出Direct3D - S2框架,基于稀疏体积构建,有空间稀疏注意力机制,加速计算,还引入统一格式VAE,生成质量领先,训练成本更低。
独家 | 开普勒联合创始人胡德波成立「索塔无界」,聚焦通用基座模型+海外市场
AI科技评论独家消息,开普勒机器人联合创始人胡德波2026年4月成立索塔无界。该公司聚焦通用基座模型,以统一潜空间世界动作模型为核心,提出物理智能大脑技术路线,已与欧美企业达成合作意向。
数百个虚拟人在线逃生!天大等发布:首个实时在线多智能体模拟方法
天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。
谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...
谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。
AI正在改写地图APP!这一次轮到谷歌了
谷歌让开发者可通过Gemini API调用谷歌地图工具,整合位置感知功能。支持多模型,按查询次数收费。玩法多样,能个性化、实时化处理需求。国内高德早有相关尝试,AI正改写地图APP。
评论送书 | Al智能体与传统AI应用的区别?它如何工作?如何快速构建智能体?
文章对比AI智能体与传统AI应用,指出前者更像“乐高积木”,可融入生活工作。介绍其工作是“感知—推理—执行—学习”循环,还给出快速构建通用方法,如明确目标、选框架等。
Anthropic:大模型开始意识到自己在想什么!
Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。
北大校友Lilian Weng出镜,爆出120亿估值首个交互模型!
北大校友Lilian Weng出镜介绍Thinking Machines的交互模型,此模型200毫秒神同步,能感知协作。该公司此前获20亿美元种子轮融资,估值达120亿美元。模型打破传统交互局限,或改变人机互动方式。