「能力边界」共找到 3382 篇相关文章
告别通用具身模型崇拜:具身智能走向异构策略编排
当VLA、WAM等机器人控制策略在各自任务中表现出色,如何为子任务匹配合适策略成完成复杂长时序任务关键。RoboHarness解决异构策略协同难题,通过协同调用策略提升成功率。
GPT-5「全家桶」爆出本周上线!惊艳首测秒出网页,编程彻底起飞
传闻GPT - 5发布时间提前,本月底面世,它有4个版本。网友在LMArena实测,GPT - 5 - pro能一键生成网站,GPT - 5 - high表现出色。美国部分公司已拿到预览版,其新功能或改写编程局面。
为了「自我锤炼」,OpenAI 造了一个攻击力极强的「AI 黑客」
OpenAI宣布扩展网络安全计划Daybreak,推出GPT‑5.6‑Cyber,分蓝队和红队。红队模型模拟黑客找漏洞,能力强悍,高危安全任务完成率达95%。但此举也带来安全风险,OpenAI采取分级授权等措施。
国产开源大模型:再见9月,你好10月~
9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。
给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集
随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。
研究表明:资深开发者在使用AI工具时,完成任务的时间比不使用时延长了19%。
研究通过随机对照试验,发现2025年初资深开源开发者使用AI工具完成任务时间比不使用时延长19%。当前衡量AI能力多依赖标准化评测,可能高估或低估其真实能力,研究旨在更准确评估。
Harness is the New Dataset:模型智能提升的下一个关键方向
文章指出当基模能力成熟,决定 agent 上限的是围绕模型搭建的系统,即 harness engineering。介绍其组件、设计原则,探讨模型与 harness 关系,还列举创业机会项目,最后推测下一范式是 Coordination Engineering。
通用Agent长啥样
视频探讨大厂做基于命令行编程工具的原因,介绍命令行Agent,剖析其等于庞大工具生态、经典Unix组合哲学与现代AI调度能力,指出通用Agent骨架由AI大脑、命令行身躯和MCP感官构成。
魔法原子,105亿瞄准具身智能终局
2026 年很多行业被 AI 重塑,具身智能赛道尤为明显。魔法原子推动生态基金布局,撬动超 105 亿资金,完成 5 亿融资。它推进多维度‘连接能力’,构建系统能力与落地场景,成资本与行业关注样本。
Nano Banana Pro上线!集成Gemini 3与Veo 3,谷歌不给竞争对手喘息机会
谷歌推出最强文生图模型Nano Banana Pro,又名Gemini 3 Pro Image,整合Gemini 3 Pro多模态理解能力与谷歌搜索知识库。它提升文字渲染等能力,支持多种分辨率和格式,还集成视频生成模型,覆盖多类用户。