「Coding 基准测试」共找到 2878 篇相关文章
Claude 4发布!世界最强编程模型来了
Anthropic发布Claude 4家族,含Claude Opus 4和Claude Sonnet 4,代码能力强,重新定义AI编程助手能力边界。有新功能,企业认可,Claude Code上线,记忆能力提升,立即可用且价格不变。
确认!DeepSeek多模态AI已经开测
DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。
成本降九成,准确率100%!MIT反常识架构挑战硅谷信仰
慕尼黑工业大学等研究者指出企业AI落地问题源于数据乱。RUBICON架构用AQL查询语言,把操作权交用户,让LLM在精确范围工作。测试中它准确率100%,成本低,优于现有智能体AI方案。
DeepSeek R2没来,DeepSeek R1+来了~
DeepSeek官方发布通知,DeepSeek R1模型完成小版本升级成DeepSeek - R1+。PaperAgent实测近1000行代码无错,网友测试显示CoT有显著变化、前端审美提升,还提及DeepSeek - R2可能快来了。
52天73次产品级更新,个个爆款太神了,AI原生组织的进化恐怖如斯
2月1日到3月23日,Anthropic在52天内进行73次产品级发布,Claude Code和Cowork表现亮眼。其核心是把AI当基础设施,实现商业化且推动公司高估值,给传统组织带来冲击,AI赛道成组织进化竞赛。
Anthropic深夜再出杀招!编码AI一键清空桌面,白领末日来临?
Anthropic推出办公神器Cowork,复用Claude Code底层逻辑,可完成日常任务,如整理桌面、处理文件等。它上手门槛低,主动性强,还能持续升级。不过其诞生或冲击初创公司,也需留意使用权限和安全问题。
Vibe Coder 之死
文章围绕Vibe Coder之死展开,讲述机器人因Vibe Coding失控视频走红,引发对机器人安全热议,探讨其危害、发生可能性、防范措施等,指出当前AI发展枉顾安全,还提及人们对AI+机器人未来的多种看法。
GPT Image 2研究科学家陈博远:我在OpenAI修中文
GPT Image 2发布引发AI圈震动,主力训练者陈博远分享幕后故事。他和奥特曼同台主持,修好中文渲染,给模型起代号“布基胶带”,还设计多种“彩蛋级”测试,抖出官网图片幕后花絮。
刚刚发现,Claude桌面版支持第三方模型了,没账号也可以用Cowork,开关在这
作者年初后无法用Claude账号,上周五发现Claude桌面版(Mac)支持第三方模型,开关隐蔽。还介绍配置方法,以及Claude Cowork和Code模式特点,最后提及新模型及个人多模型使用情况。
分割一切、3D重建一切还不够,Meta开源SAM Audio分割一切声音
Meta 深夜放出音频分割模型 SAM Audio,可通过多模态提示分离任意声音。其核心 PE - AV 推动性能领先,还发布评测模型、基准等,整合进新平台,虽有局限但为音频 AI 带来新可能。