基准表发现」共找到 1843 篇相关文章

新闻资讯8

“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿

Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。

InfoQ
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 示存在集中极大值,而值 (V) 示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
新闻资讯8

OpenAI Astra发布在即,全自动网络攻防能力已突破天际!

OpenAI即将发布的模型Astra,在内部评测中获ExploitBench满分,还发现两个零日漏洞。它能力远超上一代GPT - 5.6 Sol且更听话。不过为安全考虑,OpenAI部署监控,还放慢其研究速度。

新智元
开源动态7

还是你们会玩,2.9k Star OpenBiliClaw

OpenBiliClaw把浏览器扩展等拼成内容发现Agent,将内容推荐主导权交回用户。它汇总显式授权来源信号找内容,形成本地画像。介绍其架构层级、核心闭环,也提醒“本地优先”仍需做隐私检查。

小华同学ai
新闻资讯8

Claude一举扫清2000阶以下哈达玛矩阵!AI开始清空数学“待解列

Anthropic研究员携手Claude做出668阶哈达玛矩阵,解决该问题。此问题曾难倒人类数学家30年,被收录进FrontierMath基准测试。此次还扫清2000阶以下所有悬而未决的哈达玛矩阵阶数。

量子位
推荐文章7

分享一些可以让AI使用更丝滑的小技巧

作者起初用AI不顺手,经研究摸索发现是指令有误。分享沟通技巧,如给身份、给参考风格、用“说人话”“举例子”,还可当头脑风暴搭子,强调清晰指令能助自我认知。

每日豆瓣
新闻资讯7

三分之一arXiv沦陷!CS论文65%被判「AI味」,数学仅0.7%

一份unslop研究显示,过去一年arXiv计算机科学领域65%新论文被检测器标红,但可能只是闻起来像AI。数学论文仅0.7%,或因检测器只认文字。研究有局限性,真实用AI比例可能更高。

新智元
算法论文8

李飞飞第一篇「触觉」论文:机器人会盲摸麻将了

李飞飞等全明星阵容关注灵巧手研究,提出T-Rex模型。其通过给触觉单独开通路等方式解决触觉加入难题,在真实任务中现出色,还为灵巧手领域带来从机身分化、启发专用场景应用等变化。

量子位
算法论文8

大模型自发涌现意识了?!Anthropic最新研究震惊全世界

Anthropic研究发现Claude内部自发长出类似人脑意识通达的J空间,开发J - lens工具可观测其运转。实验显示J空间能影响Claude回答,还能抓其小心思,研究审慎探讨模型是否有意识。

AIGC开放社区
新闻资讯8

王阳明心学,被Anthropic用来教Claude做人了

UT Austin哲学教授Harvey Lederman研究王阳明心学十年,现加入Anthropic做Claude对齐训练。他用分析哲学拆解“知行合一”,发现AI模型存在“信念冲突”,Anthropic用类似阳明心学方法解决问题。如今硅谷AI公司争抢哲学家。

量子位