视觉推理任务」共找到 3973 篇相关文章

算法论文8

VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测

近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。

机器之心
开源动态7

Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小

Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。

InfoQ
推荐文章8

陶大程技术博客首发:从像素复刻到行动控制,具身世界模型的底层逻辑探索|甲子光年

今年世界模型成AI热点,通用世界模型追求像素逼真,具身世界模型不同,其使命是支撑行动。文章拆解具身世界模型底层逻辑,分享开悟世界模型的技术设计与实践思考。

甲子光年
产品应用7

Google推出Gemini Spark:不用开电脑也能24小时跑

Google在2026年I/O大会推出个人AI代理产品Gemini Spark,是24小时数字生活助手。它搭载Gemini 3.5大模型,用自研Antigravity框架,运行在Google Cloud虚拟机,可对接Google工具,后续将通过MCP接第三方服务。

AI工程化
算法论文8

北航,清华,北大联合发布: 异构智能体协同强化学习!

北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。

机器之心
产品应用8

终于在国产AI上看到了Opus的影子|GLM-5深度实测

作者起初怀疑GLM - 5称对标Claude Opus 4.6、定位“系统架构师”的说法,但实测后改观。通过宝可梦策略助手、降噪网站沉浸式交互、求职招聘双边匹配三个测试,展现其系统规划、执行、纠错等能力,像真正架构师。

AI产品黄叔
产品应用7

MiniMax Agent 接管桌面:动动嘴,电脑就把活干完了 | 10+个技巧分享

介绍 MiniMax Agent 桌面端,它是 Web 端进化版,能控制浏览器、处理本地文件。文中分享了其使用技巧,如环境配置、文件管理、垃圾清理等,还提及多种实战场景及玩法,凸显其主动性优势。

AI进修生
新闻资讯8

从Transformer到GPT-5,听听OpenAI科学家 Lukasz 的“大模型第一性思考”

2017年《Attention Is All You Need》提出Transformer架构,重塑AI版图。其作者“Transformer八子”中,Lukasz Kaiser加入OpenAI,参与GPT-4、GPT-5等研发。他10月将出席大会分享见解,曾预言多模态等趋势已渐成现实。

AI科技大本营
推荐文章7

Workflow和Agent的本质区别

文章介绍Workflow本质是定义任务及关系,核心是‘依赖关系’;Agent能感知环境、自主决策,核心是‘决策与执行’。二者相辅相成,抽象层次不同,还引出Agentic Workflow概念。

newtype AI
新闻资讯8

字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军

字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。

AGI Hunt