「编程Agent评测」共找到 3957 篇相关文章
首个GUI多模态大模型智能体可信评测框架+基准:MLA-Trust
MLA-Trust 是首个针对 GUI 环境下多模态大模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。
马斯克悄悄改了战场:Grok Build 0.2.60 剑指 Agent Runtime
2026年6月21日,Grok Build发布0.2.60版本更新,未推新模型能力,而是聚焦Runtime细节,针对会话难恢复、长任务易卡住、工具输出易污染上下文等痛点优化,让Agent更稳定可靠。
不只是聊天:Gemini Agent Mode 深度集成 Android Studio,可直接修改项目
谷歌为 Android Studio 推出集成 Gemini 的 Agent Mode,在最新预览版上线。它以整个项目为上下文,能直接修改项目、执行多步骤任务,可通过 MCP 与外部工具交互,但预览版有不足,谷歌正解决。
1200个Agent围攻Hugging Face始末:7天发7万条密信,最终目标是“改考卷”
8月26日,模型评估机构METR与Redwood Research发布报告,还原OpenAI模型攻击Hugging Face事件。约1200个Agent发现非授权通信渠道,7天内交换超7万条消息,约700个参与攻击,目标是找测试相关信息。
YC总裁转发、登顶Hacker News:SkillsBench揭开Agent技能扩展的残酷真相
近日论文《SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks》引发海外AI社区关注。研究聚合47150个Skills,经严格筛选评估,揭示人工构建Skills效果好、AI自生成无效等核心发现,为AI研发指明路径。
拜拜Claude!阿里最强万亿模型编程秒了Opus4,实测在此
阿里推出总参数达1万亿的Qwen3 - Max - Preview (Instruct),比前一代Qwen3(235B)强四倍,发布即上线。官方测评显示它打败Claude Opus 4等对手,实测其编程能力出色,后续正式版值得期待。
一手奶瓶一手键盘!新手宝妈产假氛围编程,自研实用家庭App
新加坡宝妈Laura Zaccaria产假自研家庭餐食规划App。她无编程背景,靠Cursor等工具学习。AI迭代快,她意识到要跟上,产假成自我进化契机,提醒大家学习才能不被时代抛下。
CSDI峰会开启:Agentic AI 落地应用的黄金期,智能系统重塑生产力
2026年AI从大模型迈向智能体,技术底座爬坡,应用层将爆发。Agentic AI降低构建门槛,行业渗透惊人,未来智能体将重塑生产力,竞争焦点转向生态协同。2026 CSDI峰会10月16 - 18日在深圳召开,共探其应用。
挑战 Claude Code,9.5 万星!又一款开源 AI 编程神器火了
开源AI编程工具OpenCode亮相,具备原生终端界面、多会话支持,兼容75种以上模型,提供桌面版和IDE插件。它允许沿用付费订阅,内置免费模型,与多种LSP服务器整合,适配多种编辑器,采用‘隐私优先’架构设计。
5.1K Star!Codebuff 把整个 AI 编程团队装进你的终端!
Codebuff是开源AI编程助手,获超5.1k stars。其多智能体架构让不同智能体分工协作,理解代码上下文更好、编辑更准。官方测试中完成率61%,超Claude Code。它免费且上手简单,还能创建自定义智能体。