核心认知能力」共找到 4793 篇相关文章

新闻资讯8

Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想

UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。

机器之心
7

突发|Andrej Karpathy官宣加入Anthropic!

周二晚间,Andrej Karpathy在X上自宣加入Anthropic,将在核心预训练团队工作。他是AI领域极具影响力人物,曾任职OpenAI、特斯拉等。此次加入或助推Anthropic上市,也让OpenAI面临压力,或引发新一轮AI军备竞赛。

机器之心
算法论文8

让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR

京东和中科院信工所开展Self - Taught RLVR系列研究,连发三篇论文。从RLSD、NPO、CoPD三个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。

量子位
新闻资讯8

伯克利神作背刺OpenAI:持续学习才是真神!

伯克利等机构发布FST框架,通过快慢分层解决大模型持续学习死局。过去两年头部实验室都在提升模型推理能力,却忽视持续学习。FST让模型像大脑一样快慢分层,提升数据效率、减少遗忘,使持续学习可工程化。

新智元
推荐文章7

没有AI也能活得很好的公司,才能用好AI

多数企业推进AI时,虽采纳率高但效果不佳,投入大回报低。问题核心不在AI,而在企业自身组织学习和集成准备度。能从AI获益的是原本就运营良好的公司,当下应审视自身是否适合用AI。

DeepTech深科技
开源动态8

谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜

在大模型竞争白热化背景下,谷歌为解决开发者难题推出 Agent Skills。官方仓库含多项技能,涵盖谷歌云核心服务及架构支柱技能,还提供常见任务流程指南,兼容多平台,能省开发代码。此前还有 Addy Osmani 开源的技能库。

InfoQ
产品应用8

3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一

商汤绝影Sage端侧大模型在PinchBench评测中,以94%任务完成率超越Claude、GPT - 5.4等主流大模型。它激活参数仅3B,算力需求低,还具备多项实用场景能力,靠SCOUT和ERL两项自研技术提升性能。

新智元
开源动态8

首篇自进化智能体系统技术报告出炉:Token成本直降近10倍,省钱又高效!

全球首个基于‘上下文信息密度最大化’的自进化智能体系统GA发布技术报告。它在多基准测试表现惊艳,能省近10倍Token,还能自我进化。报告深度解读设计理念,剖析自进化能力与智能体设计思路。

机器之心
开源动态8

狂揽 1.9 万标星!谷歌大神开源的 Agent Skills,直接提升 AI 编程的交付质量!

谷歌Gemini团队主管Addy Osmani开源的Agent Skills项目火了,已揽1.9w+ Star且还在增长。它是AI编程代理人的工程技能库,有20个核心技能,覆盖开发全周期,可提升AI编程交付质量,支持主流编程工具。

开源星探
推荐文章8

linux.do:一个被严重低估的中文技术社区,国内懂的人都在偷偷用

本文介绍了中文技术社区 linux.do,它上线两年多,虽访问量已追上老牌社区 V2EX,但很多人不知其存在。其核心围绕 ChatGPT 和大模型,有一手信息、开源协作氛围和活跃管理团队,还给出注册及避坑建议。

AI Reading Hub