核心认知基准」共找到 2705 篇相关文章

开源动态8

The Batch: 855 | 为智能体而生

总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列大语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。

DeeplearningAI
开源动态8

扣子官宣开源,掀桌大动作背后如何决策?扣子负责人独家披露

7月26日,字节将AI Agent平台「扣子(Coze)」旗下Coze Studio与Coze Loop开源至GitHub,采用Apache 2.0许可证。文章披露开源决策背后故事,探讨开源版目标、定位,以及团队对Agent开发未来的思考。

InfoQ
产品应用7

怎么从 ChatGPT 拿流量?送上这九条实用建议

文章指出AI问答引擎成B2B采购决策重要‘守门人’,介绍问答引擎优化(AEO)概念,还通过采访提炼九条从ChatGPT等拿流量的实用建议,如明确提问场景、了解平台差异等。

Founder Park
新闻资讯7

突发!Cognition宣布收购Windsurf:看上的还是AI人才

Cognition宣布收购Windsurf,旨在构建软件工程未来。此次是全面整合,获其核心产品、IP、强劲业务、庞大用户基础及顶尖人才。Cognition还提供员工保障方案,战略协同有望变革软件开发模式。

AI寒武纪
算法论文8

感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义

伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。

量子位
新闻资讯8

刚刚,Grok 4发布,「人类最后的考试」中拿下50.7%,碾压所有对手,游戏结束?

Grok 4发布并对X Premium+订阅者开放。它是领先的AI模型,人工智能指数超对手,全方位性能爆表,还具备实用功能。在「人类最后的考试」拿下50.7%,显示AI智能增长无上限。

AGI Hunt
算法论文8

一篇Graph+AI Agents最新技术综述

该综述提出分类框架组织Graph与AI Agents领域研究进展,详细探讨图技术在AI代理规划、执行、记忆和多代理协调等核心功能中的作用,还提及代表性应用、挑战和未来机遇。

PaperAgent
产品应用8

比10年专业医生准4倍!微软发布突破性医疗AI系统

微软首席执行官分享新发布的医疗AI系统MAI - DxO,它模型无关,能适配不同语言模型,模拟医生诊断流程。测试显示其准确率远超专业医生,成本大幅下降。此外还发布序贯诊断基准SDBench。

AIGC开放社区
新闻资讯8

韦东奕论文登数学顶刊,将散焦方程的爆破性研究扩展至d≥4

韦东奕和北大学者章志飞、邵锋合作的论文发表于数学顶刊《Forum of Mathematics, Pi》。他们将散焦方程的爆破性研究扩展至d≥4,成果填补空白,证明方法可推广到其他方程。

量子位
算法论文8

通义实验室最新成果WebDancer:开启自主智能Deep Research的新时代

通义实验室推出 WebDancer,解决自主信息检索智能体构建难题。它创新合成训练数据,采用两阶段训练策略应对开放网络训练挑战,在多个基准测试中表现卓越,未来还将拓展能力。

机器之心