「编程Agent评测」共找到 3990 篇相关文章
智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草
近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。
AI Agent搞定世纪首次菲尔兹奖成果形式化!一周时间独立完成,20万行代码已公开
Math公司的AI Gauss用5天完成原本需6个月的菲尔兹奖级数学成果形式化证明,一周搞定24维情形,还修正原论文错误。其创始人是xAI联合创始人Christian Szegedy,代码已公开。
Agent、图像、视频全是大版本升级:春晚还没开,豆包AI就火了
2026年AI市场竞争激烈,海外公司密集发布新模型致华尔街震动。国内腾讯、阿里、字节参战,字节官宣豆包参与春晚互动。2月14日火山引擎宣布豆包系列模型全面升级,含大模型2.0、图像模型Seedream 5.0 Lite、视频模型Seedance 2.0。
姚顺宇谷歌首秀,Gemini新模型刷爆SOTA:人类仅剩7人捍卫碳基编程
面对Claude Opus 4.6和GPT Codex 5.3的攻势,谷歌升级Gemini 3 Deep Think,在多项基准测试刷爆SOTA,推理成本降低82%。它还走进科研工程领域,其研发团队有不少华人,如姚顺宇、Yi Tay。
烧掉数万亿 Token、数百 Agent 连跑一周:Cursor“从零写浏览器”,结果是拼装人类代码?
Cursor CEO分享用GPT - 5.2让系统运行一周从零构建浏览器的实验,产出大量代码。但实验引发质疑,项目编译难通过,代码还依赖成熟库,像是拼装人类代码,且实验成本高。
对话光帆科技董红光:Manus 让 Agent 走红,但真正的 AI 载体不只有手机
本文是对光帆科技创始人董红光的专访,围绕AI时代的交互与硬件趋势展开。董红光认为AI最合适载体非手机,光帆发布全球首款视觉感知AI耳机,介绍了产品设计原理、操作系统研发等,并探讨了AI硬件市场现状与未来。
OiiOii意外走红背后:为何10万人排队等一个不完美的AI Agent?|甲子光年
OiiOii是成立不到半年、团队仅十余人的初创公司,产品尚处内测,却引来近10万人排队申请。创始人闹闹有丰富履历,不回避产品缺陷,公司已获天使轮融资,将全力投入迭代。
Meta|提出RECAP,通过动态目标重加权回放,解决RLVR遗忘【文末送书!Agent相关】
近年来,可验证奖励强化学习(RLVR)提升了大模型在多任务上的性能,但带来“能力退化”问题。Meta等提出RECAP策略,结合“回放”与“动态目标重加权”,保持模型通用能力,提升推理性能,还提高推理效率。
开源即登榜!登顶全球前十AI编程智能体,UCL初创团队开源Prometheus
UCL初创团队EuniAI开源AI软件智能体Prometheus,在SWE - bench Verified上Pass@1达71.2%,成绩入官方主榜。它有图结构推理设计,能理解代码,成本低,官网有Demo展示其工程化能力。
跨越技术与法律的壁垒:AI赋能知识产权领域任务全能评测基准IPBench发布
本推文介绍arXiv论文《IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property》。论文提出IPBench评估基准,构建含20个任务、10374个双语数据点的基准,评估17个主流模型,揭示现有模型在IP任务中局限。