测试方法」共找到 3061 篇相关文章

新闻资讯7

“现代 AI 九成突破都来自我们!”面对核心团队被挖,谷歌 DeepMind 掌门人的回应挺硬

谷歌股价下跌,核心团队被挖,引发对其大模型地位的担忧。但 DeepMind 创始人哈萨比斯回应有底气,谈技术观点,如靠文本模型难以实现 AGI,智能需理解物理世界,还提及水印、创意等问题。

AI科技大本营
新闻资讯7

AI软递归自我提升,Hassabis夜不能寐:人类已至奇点山脚

AI递归自改进和研究自动化正从概念走向现实,哈萨比斯称人类站在「奇点山脚」。Claude已独立编写超80%代码,Anthropic工程师效率大幅提升。但AI递归也带来安全风险,全球实验室陷入「囚徒困境」。

新智元
产品应用8

将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

快手发布新版多模态大模型Keye-VL-2.0-30B-A3B,率先将DSA机制引入多模态理解场景,解锁256K超长上下文深度感知,还首次解锁Agent协作机制。该模型在多方面表现出色,且将融入业务带来收益。

量子位
算法论文8

全球排名前三,复旦自进化Harness Engineering让GPT‑5.4再涨7个点

2026 年以来,Harness Engineering 成业界热词。复旦大学等团队提出 Agentic Harness Engineering (AHE),可实现 Harness 自动优化。实验中,AHE 让 GPT - 5.4 分数提升,适配 GPT - 5.5 后排名全球第三,且有良好泛化能力。

机器之心
产品应用7

说实话提前拿到Qwen3.7-Max内测,最让我意外的不是它推理变强了!

作者提前2天拿到Qwen3.7-Max内测,经测试,该版本补齐短板,综合能力强。审美提升明显,代码质量不错,长程思考推理迭代能力佳,适合替换到部分工具里。

探索AGI
算法论文8

行为记忆+认知记忆,中科大MemWeaver重构LLM个性化记忆

论文MemWeaver被The Web Conference 2026接收,它聚焦用户从隐式到显式文本交互时个性化生成的升级问题。提出将用户历史升级为层次化记忆,构建行为与认知双记忆模块,主实验表现优,消融实验验证其结构设计关键。

PaperAgent
算法论文7

700多个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料

Anthropic故意训练近700个「有问题」模型,训了LoRA适配器(IA)让模型自报家门。IA在AuditBench平均成功率59%,但也存在幻觉、成本高、训练分布无指南等局限。

新智元
算法论文8

让大模型自己写代码、自己进化,GIM和港大这篇ACL主会,把量化因子挖掘重做了一遍

香港大学和GIM提出CogAlpha框架,将Alpha从‘公式’升级为‘代码’,搭建7层21个智能体探索体系,让大模型参与研究流程。在5个数据集上跑赢21个基线方法,还具可解释性。

机器之心
算法论文8

Transformer可以改装成Mamba了:苹果把推理成本直接打成线性

苹果将Transformer改造成Mamba,采用‘两步走’策略,先造中间形态,再转成Mamba,避免性能崩塌。实验显示,新方法性能几乎没掉,成本逻辑改变,为模型降本重构提供新可能。

机器之心
新闻资讯8

Claude Opus 4.7连夜突袭:或将抢走全球7亿打工人饭碗!

Anthropic正式发布Claude Opus 4.7,定义为当前可广泛使用的最强Claude模型。其核心升级在复杂任务执行、高清视觉理解和长链路工作流,视觉能力大幅提升,在多方面超越对手,普通用户使用有三大变化。

新智元