「进化式评测系统」共找到 2747 篇相关文章
Karpathy最新发文:醒醒!别把AI当人看,它没欲望也不怕死
Andrej Karpathy在推文中反驳将大模型视作「更聪明人类」的观点,指出大模型是「非生物」智能,其进化压力、学习机制、运行方式与人类不同。清楚这是全新智能,对理解大模型很重要。
吴恩达:AI编程加速开发也埋下大坑,软件测试空前重要
吴恩达认为AI编程虽加速开发,但Agentic编码系统不可靠,会引入漏洞、删除代码等。他给出核心解法,利用Agentic测试,优先测后端和底层架构,还明确测试优先级,前端低、后端高。
推理与操控能力双提升!具身机器人双系统VLA模型新突破
香港中文大学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。
Claude设计师被工程师卷到掉队,反手造出百万用户工具
Anthropic产品设计师Nate Parrott复盘Claude Design诞生过程。起初他在工作中被工程师拉开差距,利用业余时间捣鼓出这一工具。它以HTML为突破口,融入品牌系统,从副项目转正,定位前期视觉沟通。
具身智能“高考”难疯了!人类100分,最强模型12.8
原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。
兼顾效率、成本与能力,百灵开源旗舰推理模型 Ring-2.6-1T
5月15日,蚂蚁百灵开源旗舰级推理模型Ring-2.6-1T,权重文件上线Hugging Face、ModelScope平台。该模型有万亿参数,‘按需思考’,在代理执行、推理机制、训练范式三方面升级,评测表现出色。
第 4 章 Agent 开发实战
本章面向理解大模型、会 Python 但未系统搭建过 Agent 的工程师,采用「概念 → 最小示例 → 可运行项目」结构,介绍 Agent 开发实战,涵盖 LCEL 拼装、工具暴露等内容,还说明了开发环境搭建方法。
DeepSeek急招Agent方向!一口气放17个岗位,重度Vibe Coding用户优先
DeepSeek一口气开放17个招聘岗位,核心聚焦Agent方向,覆盖算法研究、数据评测、基础设施等全链条。岗位要求显示其Agent布局从研究落地到能力建设,还追求数据闭环与技术栈全面布局。
LinkedIn 重构服务发现:在大规模环境中用 Kafka 和 xDS 取代 Zookeeper
LinkedIn 工程博客中,Bohan Yang 介绍升级基于 ZooKeeper 的传统服务发现平台项目。因传统系统有扩展性问题,团队开发新架构,分离读写路径,实施双读双写机制,迁移后数据传播延迟显著改善。
Agent进入下一篇章!Alita:不靠人工预设,自己造工具,成绩碾压OpenAI
当前AI Agent依赖人工预设,存在工具不够用、缺乏创造力、兼容性差等问题。Alita秉持少预设多进化理念,用MCP协议,架构含三大模块,实验成绩超OpenAI,还能让小模型提效。