「核心认知基准」共找到 2705 篇相关文章
The Batch: 866|GPT-5 起飞遇乱流
OpenAI推出GPT - 5及其系列模型,涵盖多种类型,有新功能与性能提升。但发布中路由器故障等问题让用户失望。它在部分基准测试表现佳,不过抽象推理能力有不足,还回顾了发布历程。
ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准
上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。
腾讯张正友:具身智能必须回答的三个「真问题」
7月27日,腾讯发布具身智能开放平台Tairos。发布会后,腾讯张正友剖析战略选择背后的三个核心问题:架构上主张分层架构;认为具身智能第一性原理是身脑融合;强调要为长远目标放弃短期商业利益。
AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品
ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复率达60.3%居首。
独家丨盛大挖角代季峰,筹建新 AGI 公司对标 DeepSeek
AI 科技评论独家消息,盛大网络挖角清华副教授代季峰筹备新 AGI 公司,对标 DeepSeek,正招募核心团队。代季峰学术成果颇丰,项目或融合脑科学与 AI 架构,“旧互联网 + 学术”组合有挑战也值得期待。
秒改屎山代码、最高提效 300%!AI 代码审查工具会终结技术债务还是带来新危机?
当下AI代码审查工具引发热议,虽宣称提效300%,但实际表现存争议。InfoQ采访硅心科技专家,探讨其利弊、核心能力、不同工具差异等,还提及应对问题的策略及未来审查流程演变等内容。
图灵奖得主Sutton再突破:强化学习在控制问题上媲美深度强化学习?
图灵奖得主Richard S. Sutton认为未来AI发展需靠强化学习。他将2024年的SwiftTD算法拓展到控制领域,提出Swift - Sarsa算法,还设计操作性条件反射基准测试。实验显示,结合预处理方法,其性能或媲美深度强化学习。
ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?
当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。
重磅!OpenAI深夜发布ChatGPT Agent:AI打工人正式上线「附发布会全程视频」
OpenAI推出ChatGPT Agent,它整合Operator远程浏览器和Deep Research能力,Pro、Plus和Team用户可激活。能完成复杂任务,有强大工具集,性能在多基准测试超人类,但OpenAI因能力增强启动最高安全保障。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。