进化式评测系统」共找到 2747 篇相关文章

算法论文8

绝对零监督Absolute Zero:类AlphaZero自博弈赋能大模型推理,全新零数据训练范式问世

清华大学 LeapLab 团队等提出全新推理训练范式 Absolute Zero,使大模型实现「自我进化式学习」。基于此范式训练的模型 AZR,在代码生成与数学推理基准任务表现出色,缓解了大模型对人工数据依赖难题。

机器之心
产品应用8

打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”

上海人工智能实验室 OpenDataLab 团队发布 MinerU.Chem 技术报告及成果,升级化学文献智能解析能力。它能将化学文献图片转化为 AI 可用数据,解决化学知识机器难用问题,在评测中领先,还将助力 AI4S 发展。

OpenMMLab
推荐文章7

Agent架构搭建 ≠ 堆Skills

现在很多Agent架构以大量Skills为基础,但这种做法大概率会翻车。Skills机制让模型自行判断是否使用及何时使用技能,其判断不可靠,随着技能数量增多,系统可靠性变差,设计上需平衡灵活性与可控性。

newtype AI
产品应用7

OpenClaw 引爆 AI 安全焦虑,Armadin 的 Agent 攻防闭环会成为新范式吗?

OpenClaw走红使agent自主执行任务能力受关注,也带来网络安全风险。传统安全体系难应对,Google高价收购云安全公司释放信号。Armadin构建agent swarm系统形成自主防御闭环,介绍其理念、产品、案例及面临的技术挑战。

海外独角兽
开源动态8

拒绝传统 Router“瞎指挥”,多智能体如何实现智能任务分配?

企业级多智能体系统瓶颈常是负责分发任务的传统 Router 太“傻”,搞不定跨域、解不了冲突、跟不上变化。腾讯云开源 TCAR 智能路由模型,它先推理再选 Agent 集合,经多数据集评测表现出色,还提供完整开源范式。

InfoQ
算法论文8

Arc研究所造出能“举一反三”的虚拟细胞模型,破解跨细胞预测难题

生物学和药物研发中,因细胞组合庞大,难以全实验验证,且同药在不同细胞效果不同。Arc Institute 团队推出虚拟细胞模型 STATE 及评测套件 Cell - Eval,STATE 预测效果优,但也存在短板。

DeepTech深科技
新闻资讯7

AI批量轰炸苹果bug赏金计划,审核团队已下线

苹果bug赏金计划因AI冲击设冷静期,业余选手用ChatGPT批量找漏洞,让审核团队分身乏术。同时,苹果最强防御系统被AI攻破,不过防御者也能用AI工具,苹果首次在安全修复中致谢AI。

量子位
推荐文章7

OpenClaw 类自主智能体生态构建

文章围绕OpenClaw类自主智能体生态展开,从生态视角、记忆系统、上下文管理等多方面阐述其构建,还分析了安全风险、治理体系、角色分工及面临的挑战与机会,为理解和发展Agent生态提供参考。

AIGC开放社区
推荐文章8

AI 开发时代的“能力暴露与禁止空间”方法论:TPDD 与高层测试闭环

文章指出大模型加速软件开发范式演进,AI 深度介入开发带来新生产路径,但也放大风险。作者提出 TPDD 方法论,通过提前定义测试点与边界条件,平衡能力利用与风险控制,确保系统可控、安全、可持续。

InfoQ
开源动态8

最窒息的Bug:Agent循环搜索原地打转?SGR Agent用「双阶段认知」破局

Hybrid Schema - Guided Reasoning(SGR)是革命性AI研究智能体框架,用「两阶段推理 - 执行架构」和「持久化上下文记忆系统」,解决AI助手复杂研究任务的三大痛点,模拟人类研究过程,适用于多场景。

CourseAI