「能力实现率(CRR)」共找到 4904 篇相关文章
Claude 5.1来了,但最强能力只向少数机构开放
9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,二者用相同底层模型,区别在安全限制和开放范围。Fable面向订阅用户和企业,Mythos仅向少数审核机构开放,此次还尝试新的开放方式。
Claude Opus 5 发布:Fable 5 一半的价格,更强的编码能力
Anthropic 发布 Claude Opus 5,定价与 Opus 4.8 相同,价格是 Fable 5 的一半。它在编码、知识工作和推理上表现出色,虽有不足,如速度慢、幻觉率较高,但提供多种 effort 等级,成本低,安全对齐性好。
刚刚,翁荔博客又上新:通过Harness工程实现AI自我提升
翁荔新博客聚焦Harness Engineering,梳理围绕‘Harness自我优化’的研究,探讨递归式自我提升发生层面,还指出自动化研究和自我提升系统面临的瓶颈,如评估标准模糊、奖励作弊等。
Pinterest 利用内容指纹技术,在数百万个域名中实现 URL 去重
Pinterest工程师开发“最小重要查询参数集”(MIQPS)URL标准化系统,用于优化大规模数据采集管道内容去重。它取代传统方法,用数据驱动判断参数重要性,还采用早期退出逻辑等提高效率。
让LLM互相“审稿”:简单的LLM Collaboration/Ensemble方法实现7%性能提升
文章提出LLM-PeerReview方法,受学术同行评审启发,含评分、推理、选择模块。采用‘翻转三元评分技术’减少偏差,实验显示该方法超单一LLM及LLM Ensemble基线,性能提升显著。
OpenClaw 2026.3.8更新:安全认证及部署回滚能力提升
OpenClaw发布2026.3.8版本更新,聚焦安全性与bug修复。关键更新有ACP来源验证,让代理确认指令来源;更新前自动创建配置快照,可回滚设置。还修复了Telegram重复回复等问题。
刚刚,Claude实现「永久记忆」!官方还没上线,大神已玩疯
昨天Claude被曝要有永久记忆,今天开发者就用Smart Forking扩展让其拥有「可继承的长期记忆」。实测成功率100%,与官方知识库理念不同,Claude Code也破圈引发轰动。
西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速
扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。
老黄200亿「钞能力」回应谷歌:联手Groq,补上推理短板
谷歌TPU威胁刚至,英伟达砸200亿美元联手Groq布局AI新时代。知名投资人指出Groq LPU推理速度远超GPU、TPU等,但内存容量小。英伟达借此补推理短板,入局竞争激烈的推理市场。
DeepSeek-V3.2正式版发布,将开源模型的能力推向极致
DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。