「边界感」共找到 400 篇相关文章
实测最强的Cowork Agent模型M2.7,这是龙虾最好的模型搭子
实测MiniMax新发布的M2.7模型,解决了Agent的笨拙感,是国内最强的Cowork Agent模型。它技能命中率高,能自进化,对办公场景做了优化,还能解决生产效率问题,加强了人设保持能力。
「龙虾热」后,OpenClaw 会是又一个泡沫吗?
OpenClaw是受高度关注的开源项目,发布一周吸引200万访问、超10万GitHub星标。热度外溢到产品和产业,厂商推「类龙虾」产品,应用边界向AI硬件延伸,地方政府也推出支持举措,但围绕其争议也在积累。
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。
AgentIF-OneDay 发布,评估全场景长时复杂任务
红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。
刚刚,智元提出SOP,让VLA模型在真实世界实现可扩展的在线进化
智元具身研究中心提出SOP框架,可让VLA模型在真实世界实现可扩展的在线进化。它是颠覆性的机器人学习新范式,整合在线、分布式和多任务机制,构建闭环打破机器人认知时间边界。实验显示其性能优越。
性能真的不重要了吗?Jeff Dean给出反常答案
Google传奇工程师Jeff Dean更新文档《Performance Hints》,指出性能不是最后调出来的,而是写代码初始就注定的。很多人因对‘慢’无感、忽视性能,导致代码低效,顶级工程师则有‘物理地图’,能避开高成本路径。
通用模型无法完全理解用户,AI产品的下一站是上下文的战场|对话AI知识助手remio
量子位智库对话remio创始人汪源,探讨其开发初衷、核心价值等。remio主打无感自动化,成用户第二大脑,有信息捕获、管理等功能,数据本地存保隐私。还聊了目标用户、指标、功能及应对竞争等。
AI读网页,这次真不一样了,谷歌Gemini解锁「详解网页」新技能
谷歌在Gemini API上线URL Context功能,能让Gemini模型访问并处理URL内容。与普通扔链接给AI不同,它可深度完整解析文档。有深度解析PDF等能力,被指或成RAG替代方案,也有能力边界。
GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光
OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。
GPT-5刚刚正式发布,首次面向免费用户开放
OpenAI正式发布GPT - 5,有架构统一、性能大幅提升、全用户开放三大核心变化。测试数据显示性能进步明显,采用新定价策略面向所有用户开放。但演示未带来突破感,编程能力还面临Claude Opus 4.1挑战。