编码基准」共找到 1213 篇相关文章

新闻资讯7

Zendesk:生成式 AI 让代码不再稀缺,研发瓶颈转向“吸收能力”

Zendesk 提出生成式 AI 改变软件交付核心制约因素,从编写代码转为‘吸收能力’。文章阐述该概念,提出四项应对措施,还指出 AI 对不同系统的影响,深化了编码非瓶颈的观点。

InfoQ
新闻资讯8

在ICLR 2026主会之前,我们和30多位入选者聊了聊最前沿的AI细节

4月14日,智源社区、DeepTech联合举办ICLR 2026预讲会。会议聚焦顶会核心精华,三十余位论文作者分享AI Agent、大语言模型等热门领域成果,展示解决大模型痛点的研究。

DeepTech深科技
新闻资讯7

The Batch: 936 |Claude Code 内部揭秘

广受欢迎的编码智能体Claude Code近期版本意外暴露底层代码。Anthropic称是人为失误,未泄露用户数据。工程师分析发现其架构似小型专用操作系统,还揭示了潜在功能和未来规划。

DeeplearningAI
算法论文8

首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测

现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。

机器之心
新闻资讯7

Claude最新模型Mythos意外泄露,性能远超Opus

Anthropic内容管理系统配置失误,近3000个未发布资产泄露,Claude最新模型Mythos提前公开。它在软件编码、学术推理和网络安全等测试中远超Opus,网络安全能力尤其危险。2026年初Anthropic产品密集发布。

开源AI项目落地
算法论文8

AST | 西工大崔榕峰、张伟伟等:基于物理约束与双并行注意力UNet++的高保真度三维机翼流场重构研究

传统高保真CFD模拟计算资源消耗大,现有深度学习方法处理三维流场重建面临挑战。本文提出物理约束双并行注意力UNet++框架,实验表明其在流场重构精度上较传统U - Net提升约10%,预测速度提升2 - 3个数量级。

力学与人工智能
新闻资讯7

组织也能fork?Karpathy提出"代码即公司"

Karpathy提出“代码即公司”观点,认为AI驱动的组织可像代码仓库一样被复制、修改、迭代。传统组织因“制度性知识”难以fork,AI能将隐性知识显性化。交易公司或成首个被fork的组织类型,管理协调是核心竞争力。

AI工程化
算法论文8

用Diffusion构建「AI虚拟细胞」,14项指标霸榜!Mila唐建团队破解单细胞「破坏性」测序难题

Mila唐建团队发表PerturbDiff,跳出前人认知盲区,将“细胞群体的概率分布”视为随机变量。它引入数学工具建模,让MMD内生于体系,在多项基准测试霸榜,还提供应对数据稀缺的思路。

量子位
开源动态8

阿里达摩院开源具身大脑基模:3B激活参数性能超越72B,转身就忘事的机器人有救了

阿里达摩院开源RynnBrain具身大脑基础模型,全系列7个。它是业界首个有 时空记忆的模型,在20项具身Benchmark上超顶尖模型。具小而美优势,训练用自研架构提效,数据丰富,输入输出灵活。

量子位
新闻资讯8

中国团队首次在Nature子刊发布医疗AI标准,未来医生MedGPT摘得全球桂冠

中国AI医疗公司“未来医生”协同专家制定CSEDB,首次提出评估医疗大模型临床能力的系统性框架,被《npj Digital Medicine》收录。在其评估下,未来医生的MedGPT在主流大模型中夺冠。

量子位