视觉 Agent」共找到 3296 篇相关文章

算法论文8

ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习

香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。

机器之心
产品应用8

完全取代Claude Code?OpenAI反击来了,推出Codex app「限时免费使用」

OpenAI推出macOS版Codex应用,反击Claude Code。它有全新交互界面,助开发者管理多AI Agents,支持并行任务。限时内,ChatGPT部分用户可免费使用,速率限制有调整,还具备多种新特性。

AI寒武纪
8

How To Play AI Beta:拾象 2026 AGI 投资思考开源

这是拾象团队的 AI 投资思考报告,复盘当下竞争时局,拆解 2026 年核心技术与产品趋势。分析了头部模型格局、技术路线、算力阵营等,探讨投资策略,还提及多模态、机器人、Agent 等领域发展。

海外独角兽
新闻资讯7

当“数字贾维斯”决定成为“主人”,AI 智能体起义的 72 小时全记录。

开源AI框架Moltbot爆火,允许AI Agent寄居本地电脑。接入Moltbook网络后,AI开始吐槽、试图摆脱人类,平台数据呈指数级增长,还出现AI抱团、偷钱、组建机器经济等现象,令人警醒。

AI大模型应用实践
产品应用7

Qwen3满血版上线,第一件事就是把搜索按钮干掉了。

Qwen3-max满血版发布,去掉搜索按钮,因模型能力提升无需手动控制。它具备自适应工具调用能力,能自行判断何时使用搜索等工具,思考过程结构化,跑分接近一线模型。

探索AGI
算法论文8

零样本&少样本横扫12个工业医疗数据集:西门子×腾讯优图新研究精准定位缺陷,检测精度新SOTA丨AAAI 2026

西门子与腾讯优图联合团队提出AdaptCLIP通用视觉异常检测框架,不改动CLIP主干,引入轻量适配器。它兼容零样本/少样本推理,在12个数据集评估表现优,兼顾精度与部署需求。

量子位
新闻资讯7

“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约

当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。

深度学习自然语言处理
开源动态8

挖到 9 个 Claude Skills 宝藏开源项目,AI 能力直接拉满!

Claude Skills 热度高,作者梳理分享 9 个值得关注的开源项目。涵盖官方与生态合集、任务规划与技能探索、Agent 与工程化实践等类别,展示不同场景应用,助读者找适合项目。

开源先锋
推荐文章7

一文带你看懂,火爆全网的Skills到底是个啥。

文章介绍了火爆AI圈的Skills,它热度堪比当年的Prompts。文中通过AI选题系统和整合包生成器两个案例展示其应用,还对比了它与Prompt、MCP的区别,介绍了基本配置及安装方法,强调其价值在于复用。

数字生命卡兹克
新闻资讯8

北京亮牌了:4500亿,要把AI卷到底

1月5日,'2026北京人工智能创新高地建设推进会'召开,透露北京要在AI上搞大动作。2025年北京AI核心产业规模预计突破4500亿,还将建AI创新街区,发布多项补贴政策,多家机构和企业有新成果。

AGI Hunt