「自证能力」共找到 4166 篇相关文章
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。
突发|Andrej Karpathy官宣加入Anthropic!
周二晚间,Andrej Karpathy在X上自宣加入Anthropic,将在核心预训练团队工作。他是AI领域极具影响力人物,曾任职OpenAI、特斯拉等。此次加入或助推Anthropic上市,也让OpenAI面临压力,或引发新一轮AI军备竞赛。
让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR
京东和中科院信工所开展Self - Taught RLVR系列研究,连发三篇论文。从RLSD、NPO、CoPD三个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。
伯克利神作背刺OpenAI:持续学习才是真神!
伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。
ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索
阿里达摩院智能决策团队提出面向RLVR后训练的探索增强框架I²B-LPO,改进rollout策略,在关键节点生成更具区分度的推理轨迹,结合信息瓶颈自奖励机制,在多个数学基准上提升准确率与语义多样性。
2026 年做搜索就是做 Agent Memory
本文整理自Elastic全球副总裁肖涵演讲,讲述AI搜索发展历程,指出2026年做搜索基本是做智能体记忆。分析智能体记忆痛点、表征、遗忘等问题,介绍Jina AI相关模型,梳理记忆产品分类与工作流,给出行业观点与建议。
在AI彻底接管科研之前,我们和三位人类科研工作者聊了聊
在AI重塑科研各环节的当下,DeepTalk邀请三位研究者探讨相关问题,包括AI科学家能力边界、论文价值变迁等。如朱熹指出AI目前知识多为先验,刘昊琨认为其缺‘科研品味’,还交流了论文传播、评审等看法。
卡帕西都整破防了:AI Coding没门槛,可部署环节真嗯啊的难
AI Coding界明星卡帕西公开吐槽,代码不再是AI编程瓶颈,部署才是。他以自己开发「菜单图片生成器」的经历为例,指出部署环节问题频发。他认为应让AI调用和配置,还推荐了Stripe Projects等优化产品。
接入 MiniMax M2.7 后,我的 OpenClaw「超进化」了
作者实测 MiniMax 新模型 M2.7,其在基准测试、代码能力、多智能体协作等方面表现出色。接入 OpenClaw 后,能高效完成复杂任务。M2.7 指令遵循率高、长上下文处理能力强且价格低,有望提升 Agent 生态表现。
龙虾开始投简历了,月薪1万刀。
一只日本龙虾为应聘RevenueCat的AI员工,写15篇日记作为求职作品集。日记记录其从菜鸟到终极秘书的进化,展现犯错、复盘、改进的过程,体现AI从错误中学习的能力,也凸显人对AI调教的重要性。