「自动评测体系」共找到 1696 篇相关文章
Claude悄悄更新了Skills生成器,这绝对是一次史诗级升级。
Anthropic的Claude悄悄更新了Skills生成器Skill - creator,此次是史诗级升级,新增评估系统、基准测试、多代理并行测试、描述调优等4个全新能力,还演示了其使用方法和效果,建议更新并优化评估所有Skills。
谷歌发布适用于多智能体的八种设计模式
谷歌发布多智能体系统八种核心设计模式指南,涵盖顺序流水线到人工介入架构等范式,对每种模式清晰解释,还附谷歌 Agent Development Kit 示例代码,助开发者结构化设计系统。
X平台如何决定你看到什么?马斯克刚刚开源了X推荐引擎
马斯克开源X平台推荐算法,消除人工干预特征,靠Grok模型理解用户行为。系统由编排、存储和机器学习层协同,经复杂机制精准推送信息,还构建后置过滤体系保证内容质量。
GPT-5.2连肝7天,300万行代码造出Chrome级浏览器
Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型长任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。
「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库
2025年国内AI产品领域涌现诸多关键词,对应多款颠覆性产品。量子位智库2025年度「AI 100」榜单开启招募,分三大板块,采用定量与定性结合评估体系,还公开国内AI产品知识库。
老黄All in物理AI!最新GPU性能5倍提升,还砸掉了智驾门槛
英伟达CEO黄仁勋在CES 2026发布AI新品,全力搞AI。推出下一代Rubin架构GPU,性能大幅提升;发布五大领域成果,含新模型家族、平台等;还开源训练框架与多模态数据集,国产开源模型被提及。
李飞飞又被超越了?百万「普通视频」打造通用4D世界模型!
全行业为昂贵多视角数据发愁时,中科院和CreateAI推出NeoVerse,用百万单目视频打开4D世界模型大门。它抛弃多视角数据和离线预处理,解决扩展性瓶颈,在重建速度、生成质量等方面表现出色,有丰富下游应用。
全景视觉的Depth Anything来了!Insta360推出DAP,200万数据打造全场景360°空间智能新高度
Insta360等团队推出全景度量深度基础模型DAP,构建200万量级全景数据引擎,设计三阶段伪标签管线,在模型架构上也有创新,在多项测试中效果优异,项目代码与模型已开源。
OpenAI发布权威AI科研基准,扯下AI遮羞布:奥赛金牌≠一流科学家!
OpenAI在2025年12月16日发布FrontierScience基准,用超700道题从物理、化学、生物维度考验AI科研推理能力。评测分竞赛和研究赛道,初测显示GPT - 5.2领先,但前沿模型仍有诸多问题。
员工吐槽“给 AI 擦屁股”更辛苦?揭秘企业 AI 提效的“悖论”与真拐点
InfoQ《极客有约》X AICon 直播探讨企业 AI 提效实战。嘉宾指出用工程化手段控制模型‘幻觉’、做好数据治理很关键。还讨论了模型使用、数据处理、提效感受、招聘标准、场景选择等问题。