自主智能测试」共找到 5068 篇相关文章

算法论文8

喂给AI的Skill正让它变笨!清华团队发现大模型经验复用的黄金法则

清华大学与EvoMap团队研究发现,给大模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能测试时演化。

AIGC开放社区
新闻资讯8

YC AI 创业营第一天,Andrej Karpathy 的演讲刷屏了

Andrej Karpathy在YC AI创业营演讲引发关注,提出软件3.0时代来临,大量软件将被重写。还探讨了LLMs特性、半自主工具优势等。此外,文中整理了Sam Altman、李飞飞等嘉宾的精彩观点。

Founder Park
新闻资讯7

红杉合伙人:2026,AGI已经来了

红杉资本合伙人 Pat Grady、Sonya Huang 联合发文称 AGI 已至,以 Claude Code 为代表的长周期智能体是例证,举例其自主找候选人全程仅 31 分钟。他们给出指数曲线,认为 2026 年是长周期智能体元年,但有人觉得预测太乐观。

机器之心
算法论文8

AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o

斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。

量子位
新闻资讯8

腾讯出手了!彻底入局Agent

腾讯云入局智能体赛道,将大模型知识引擎升级为智能体开发平台。该平台亮点多,如可一键发布到企业微信,具备多工具调用、多Agent协作能力,工作流有全局视野Agent节点,还有Excel检索增强功能,经测试表现出色。

开源星探
开源动态7

Vercel 开源 Open Agents,支持后台运行 AI 编码工作流

Vercel 开源 Open Agents,支持创建和运行后台编码智能体,提供全栈解决方案。它采用三层架构,核心是智能体与沙箱解耦,支持多步执行等功能,定位为参考实现,引发不同反响。

InfoQ
产品应用7

不止是玩!有人利用Clawdbot组建了一个虚拟团队接管公司业务

AI智能客服公司SiteGPT创始人分享利用Clawdbot构建AI智能体团队‘Mission Control’的经验。该团队含10个智能体,可协同工作。系统有心跳机制控成本,还有协同平台,已产出多种成果。

AI工程化
开源动态7

开源版 Claude Cowork

Multica是原生桌面客户端,将编程智能体能力带给大众,支持Claude Code等。它类似Obsidian,可按需定制,能解决编程智能体使用障碍,具备简洁界面等特性,还介绍了使用、开发、构建等内容。

GitHubStore
新闻资讯8

请回答2026:38位中国AI关键人物的Magic Moment和趋势判断|甲子光年

甲子光年与38位中国AI关键人物对话,总结2025年Magic Moment,展望2026年技术趋势。2025年是中国AI关键年,2026年大家不再聚焦大模型,更关注多模态、智能体等‘系统级智能’突破。

甲子光年
产品应用8

1段话喊来13个“程序员”,阿里Qoder新模式让我躺着当CTO

作者实测阿里Qoder「专家团模式」,该模式下Qoder组织赛博工程团队,自动解析需求、分配任务,多智能体协同推进项目,解决了代码质量和效率问题,开启多智能体协同编程时代。

量子位