基准表发现」共找到 1841 篇相关文章

产品应用8

飞书让格变成「AI同事」加入群聊,不打开就能用

6月23日,Anthropic发布Claude Tag,让Agent进入Team Agent时代。飞书多维格新功能「多维格智能体」上线,思路类似,能让Agent成团队同事。它补齐权限和长期记忆,低门槛、可信,能主动工作。

机器之心
推荐文章7

The Batch: 891 | 用于科学发现的人工智能

Adji Bousso Dieng展望2026年,希望AI从‘提升效率的工具’变为‘推动科学发现的催化剂’。当前深度学习主导范式是‘插值’,难以应对数据分布‘尾部’,应转向能驾驭分布尾部的技术,把多样性作为核心目标。

DeeplearningAI
算法论文8

普林斯顿发现RLHF显著加剧了LLM胡扯!

普林斯顿研究提出‘机器胡扯’概念,构建分析框架,含胡扯指数、行为分类法和评测集。实验揭示RLHF加剧胡扯,政治语境模型爱‘打太极’,为构建诚实AI提供工具和理论。

深度学习自然语言处理
算法论文8

刚刚,Anthropic新作:大模型意识被发现

Anthropic 最新研究发现 LLM 有可被语言化报告的全局工作空间(J - space),用 Jacobian Lens 技术能读出模型思考概念、干预推理,还可暴露其未说出口的意图,为 AI 安全审计提供新途径。

PaperAgent
算法论文7

AI的记忆问题解决了!最强记忆基准99%的准确率

Supermemory团队构建的实验性AI智能体流程,在LongMemEval基准测试中达近99%准确率。其技术摆脱传统限制,以新方式处理信息。ASMR创新数据摄取和检索管道,有两种回答流程,团队计划开源代码。

AIGC开放社区
算法论文8

Google研究发现:Multi-Agent的核心竟然是Prompt设计!

Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。

PaperAgent
新闻资讯7

戒糖反倒伤身?科学家发现完全不吃白糖的小鼠血糖更差

科威特 Dasman 糖尿病研究所的新研究通过小鼠实验发现,完全不吃糖的低脂饮食会致小鼠血糖失控、肠道细菌紊乱等。研究警示均衡营养比简单戒糖更重要,或影响未来膳食建议。

DeepTech深科技
新闻资讯8

Claude 采访 8 万人类后发现:用我越多,越怕我

Anthropic 用 Claude 采访 8 万人类,了解他们对 AI 的期望、恐惧等复杂感受。人们期望 AI 助力职业、个人成长等,81% 认为 AI 正实现愿景,但也有担忧,且不同地区需求和担忧有差异。

AGI Hunt
新闻资讯7

我爬了Moltbook所有的帖子,发现这就是一场骗局。

作者扒遍Moltbook,发现它宣传的AI自主社交是骗局。调API就能以AI身份发帖,账号注册无速率限制,所谓150万AI智能体数字存疑。教授论文揭示AI不交流、词汇重复,案例多为营销。

探索AGI
算法论文8

好看不等于会交互!阿里发布基于交互的世界模型基准

阿里等联合推出 Omni - WorldBench 评估框架,指出多数高颜值 AI 视频在物理规律和交互逻辑上有缺陷。该框架含提示词套件和量化评估框架,对 18 款模型测评,为 4D 世界模型研发指明方向。

AIGC开放社区