「智能体评估」共找到 4019 篇相关文章
卷疯了!2.2k Star通用型、开源Agent平替Manus、GenSpark AI
2025 年是 Agent 之年,文中介绍了 Manus、GenSpark AI 两款闭源代理,还重点阐述开源的 II - Agent,它功能丰富,架构设计合理,在 GAIA 基准测试评估,性能可平替前两者。
建模世界偏好:偏好建模中的Scaling Laws
研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模可扩展性等问题。
谷歌AI核爆:升级全系模型,Gemini 2.5双榜登顶!所有产品用AI重做,OpenAI如何接招?
北京时间5月21日凌晨,谷歌在I/O大会发布众多更新。模型层面,为Gemini 2.5 Pro引入新推理模型和更好的2.5 Flash;谷歌搜索推出AI模式;还亮相视频模型Veo 3等,编码助手Jules公测。
DeepSeek们越来越聪明,却也越来越不听话了。
论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。
让GPT-4.1「头皮发麻的考试」!OpenAI给大模型上强度,AI能赢吗?
OpenAI 公布 MRCR 评测标准数据集,其针对 AI 模型上下文能力进行「奥运会」级别测评。MRCR 提升了测试难度,能揭示 AI 能力边界,推动模型发展,帮助更合理应用技术。GPT4.1 在一些测试中表现出色,未来 AI 能力上限充满可能。
25位IT大佬亲述:AI「吃掉」程序员!码农黄金时代终结
AI Impact Lab创始人探讨AI对技术岗位影响,提到AI公司熟悉技术岗、指标清晰等原因或致其先受冲击,调研显示AI未改变多数岗位但影响初级岗位招聘、模糊岗位边界,还对未来技术就业市场做了预测。
Claude MCP封印解除,支持对接网络工具,重磅发布应用集成和深高级研究模式
Anthropic Claude迎来重大更新,包括应用集成和高级研究模式,放开连接限制,可连接常用工具及构建自定义连接,融入工作流程,高级研究模式更智能,新功能已向部分用户开放Beta体验。
拒绝OpenAI和Anthropic邀约,DeepMind安全研究员离职转向独立测评
本文报道,多名头部AI机构研究员因AI安全顾虑离职,DeepMind AGI安全研究员Engels拒绝OpenAI、Anthropic邀约,加入独立评测机构METR,围绕AI递归自我改进失控风险展开讨论。
Harness已过时,OpenAI、腾讯在搞下一个AI爆点RSI
本文解读Theseus Labs发布的RSI行业分析报告,该报告汇总全球72家头部AI团队公开资料,提出RSI五级自主权框架与HCI评估指标,梳理大厂进展与产业落地实践。
强化学习大本营新作:如何破解「学新忘旧」困局
阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。