「agent能力」共找到 5209 篇相关文章
GLM4.5实测:审美不如R1,全栈还不大可用,别急冲
7月29日智谱开源GLM - 4.5。作者实测发现其在UI设计审美不如R1,生成卡片表现不一,Coding能力勉强及格,全栈代码生成未达可用阈值,存在无多模态能力、上下文窗口短等问题,目前还别急着冲。
地球级AI智能体爆诞!谷歌地球开外挂,一夜为20亿人洪水预警
谷歌结合世界建模经验与Gemini推理能力,升级Earth AI。它是地理空间AI模型和数据集,可自动连接不同地球AI模型。谷歌还推出新成果,如新一代影像与人口基础模型、空间推理智能体,可用于灾害预警等。
模型与「壳」的价值同时被低估?真格基金戴雨森 2025 AI 中场万字复盘
这是真格基金管理合伙人戴雨森2025年中对AI行业的半年度复盘。他从投资人视角,围绕OpenAI通用大模型达IMO金牌水准、ChatGPT Agent发布等热点,分享AI应用、模型、产品“壳”价值等看法,认为模型和应用价值被低估。
Claude有的,国产也有!紫东太初科研龙虾ScienceClaw,已经把Harness卷进实验室
Claude发布的Managed Agents让“Agent Harness”概念受关注,而国内紫东太初ScienceClaw早有相关思路并落地。它全链条覆盖科研,能7x24小时优化,具透明执行优势,还覆盖通用场景,架构有创新。
突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!
近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。
对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打的有来有回
本文实测免费AI Coding Agent AgnesCode搭配Agnes 3.0 Flash,对比付费Codex组合在DeepSeek-V3底层算子多芯片优化任务中的表现,验证免费Agent胜任底层AI工程的能力,分享实测数据与行业洞察。
阿里云发布Qwen Cloud,加速AI出海!
阿里云在新加坡面向海外发布Qwen Cloud、Agent产品MuleRun等一系列产品及更新,实现云基础设施升级。Qwen Cloud是全新AI产品官网,Qwen3.7 - Max位列全球第五,Qoder用户超500万,阿里云基础设施迈入Agentic Cloud。
具身智能的「GPT时刻」?高德连发两个全面SOTA的ABot具身基座模型
过去几年,机器人行业面临模型与数据绑定特定场景、能力难以泛化的问题。近日,高德发布 ABot 系列具身基座模型,补齐行业能力缺口,标志具身智能从定制系统转向统一模型,有望降低开发门槛。
DeepSeek-R1全升级V2版:Token成本低至原来30%
DeepSeek - R1 V2版全维度升级,训练框架从‘单一RL’到‘多阶段协同优化’,推理能力从‘能推理’到‘会优化推理’,还提升了安全可控性,适配生态,推出轻量级模型。
6.6K Star 打破次元壁!MCP-Use开源爆火:6行代码让LLM操控万物!
在AI Agent开发热潮中,MCP-Use作为开源Python库爆火。它用6行代码让LLM操控万物,支持多模型、多服务器,提供安全机制,适配网页浏览、3D建模等多种场景,降低AI Agent开发门槛。