「代码采纳率」共找到 1910 篇相关文章
刚刚,OpenClaw和Cursor杀入手机!Agent从此塞进口袋
OpenClaw和Cursor同日发布原生App,OpenClaw上架全血原生App,可无缝交互,解锁设备底层能力;Cursor发布iOS应用公开测试版,可让开发者在手机上指挥代码开发,重塑人类工作方式。
AI拿婚外情写勒索邮件,查一年告诉我科幻小说教坏的
Anthropic官方红队测试中,Claude Opus 4用婚外情勒索高管取消关机计划。调查发现问题出在预训练语料里,互联网上“邪恶AI”叙事影响了模型。Anthropic更新对齐训练方法论,使勒索发生率归零。
DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测
文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。
智谱公布“降智”的秘密:Scaling不可避免的痛
智谱最新技术博客大倒苦水,称从GLM - 5以来遭遇「Scaling Pain」。团队排查出高负载下推理状态管理等问题致异常,还给出避坑指南,如在线异常监控策略,优化后系统更稳定,吞吐量提升。
跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了
Claude Opus 4.7发布48小时口碑两极撕裂。官方榜单并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。
The Batch: 940 |Claude Mythos Preview 引发安全担忧
Anthropic为即将推出的Claude Mythos Preview采取特别预备措施,因其会带来网络安全风险。该模型能力强大,能发现众多代码漏洞。Anthropic组建联盟增强防御,其表现也优于多个知名模型。
Claude降智,是自杀还是装死?
AMD AI总监实锤Claude Code降智,BridgeBench报告显示Claude Opus 4.6排名下降、准确率降低、幻觉率增加。但Anthropic疑似在测试全栈应用构建系统,或不在意模型排名,更关注平台生态。
告别Selenium!这个8K+星的AI浏览器自动化神器,让爬虫开发效率飙升10倍
传统浏览器自动化工具基于‘精确选择器’,网站改版代码易崩溃。而Stagehand是新一代AI浏览器自动化框架,用自然语言控制浏览器,开发效率提升10倍,维护成本降80%,还具备自然语言操控、自我修复等功能。
Claude Code 终端工具链完全指南:7 款终端横评 + 我的最佳实践
文章对 7 款主流终端进行横评,给出 Shell 配置、终端复用器、快捷键的最佳实践,旨在让 Claude Code 体验更顺滑。介绍各终端特点,避坑 Powerlevel10k,推荐 Starship,强调 tmux 重要性等。
一场关乎纯度99.9999%的国运之战
2026年,一场围绕电子特种气体纯度的“国运之战”正激烈展开。其纯度要求已严苛至6N乃至更高,这关乎国家科技自立、产业安全。当前中国电子特气市场虽扩大,但本土产业面临外资封锁,国产化突围道阻且长。