「基准测试集」共找到 2459 篇相关文章
Claude后台接管电脑,真·赛博替身!人机并行时代来了
Anthropic宣布全面升级Claude「计算机使用」能力,操作可在后台完成。该功能处于Beta测试,已向Claude Pro和Max订阅的macOS用户开放。Claude此次更新覆盖多场景,人机并行时代或来临。
AI 能力越来越强,那么它生成的代码,人类还需要去理解吗?
《代码整洁之道》作者罗伯特·C·马丁不逐行看 Agent 代码,设好测试框架通过就行。Notion 工程师 Geoffrey Litt 在会议探讨人类是否需理解代码,多数人认为需要,Litt 分享理解代码方法。
当「变大」不再是唯一的路,又一国产模型开源了
2026年6月智谱开源GLM - 5.2,心洲科技前沿实验室Mind Lab开源Macaron - V1,基座升级至GLM - 5.2。它押注持续学习与群体智能,成绩优于基座,相关理念和工程路径获验证。
满分的「差」,Qwen与复旦等揭示编程智能体奖励设计的结构性困境
Qwen团队与复旦等联合发表论文《The Verification Horizon: No Silver Bullet for Coding Agent Rewards》,指出编码智能体奖励设计存在结构性困境,任何奖励信号只是人类意图的‘替身’,验证需成系统与智能体协同演化,并研究多种验证者。
80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」
Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。
阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航
阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。
Pinterest 利用内容指纹技术,在数百万个域名中实现 URL 去重
Pinterest工程师开发“最小重要查询参数集”(MIQPS)URL标准化系统,用于优化大规模数据采集管道内容去重。它取代传统方法,用数据驱动判断参数重要性,还采用早期退出逻辑等提高效率。
19年不丢数据,擦写6万次不坏,原子级材料重新定义未来芯片
上海大学王震宇副教授团队在《自然·电子学》发文,用二硫化铌和二硫化钼做出新型非易失存储器,能保持数据约19年、擦写超6万次,还具备计算和存储两种本领,对未来低功耗计算和存内计算有吸引力。
让大模型理解真实医疗视频,全球首个开源技术方案来了!
AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解大模型元智医疗视频理解大模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。
高盛怕了!Claude Mythos全球首个攻破企业网络,奥本海默时刻来了
英国AI安全研究所研究显示,Anthropic发布的Claude Mythos Preview模型在网络安全评估中表现惊人,能全自动、全自主完成企业网络攻击模拟。高盛为此加强网络防御,人类网络安全或进入奥本海默时刻。