代码大模型」共找到 9950 篇相关文章

算法论文7

姚顺雨署名:模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench

腾讯混元团队和复旦学研究人员联手推出全新基准测试CL - Bench,系统性评估模型上下文学习能力。测试显示十前沿模型表现不佳,揭示当前模型在该能力上的普遍短板,并指出未来四个探索方向。

AI寒武纪
开源动态8

打破模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench

当前语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,对18个主流模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。

机器之心
算法论文7

函数向量对齐技术,让模型持续学习不“失忆”丨ICLR 2025

中国科学技术学等校团队破解语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。

量子位
新闻资讯7

模型玩不好数独?!Transformer作者初创公司公布排行榜:o3 Mini High“变异数独”正确率仅2.9%

Transformer作者初创公司Sakana AI公布AI解决数独能力排行榜,用全新基准Sudoku - Bench考验模型创造性推理能力。结果显示模型总体正确率仅15%,9×9数独中高性能模型o3 Mini High正确率2.9%。

量子位
推荐文章7

代码遇上模型:智能编程助手的架构设计与工程实践

在 InfoQ 举办的 QCon 全球软件开发会上,字节跳动段潇涵介绍如何基于语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。

InfoQ
新闻资讯7

Claude Opus 4.1代码实测惊人!OpenAI开源模型却只会写屎山?

昨日,OpenAI、谷歌和Anthropic等发布新模型。Anthropic推出Claude Opus 4.1,虽性能提升不,但编码能力获客户认可。实测显示Claude - Opus - 4.1写代码稳,OpenAI新模型表现不佳。

新智元
算法论文8

模型智能体不止能写代码,还能被训练成白帽黑客

Amazon AWS AI的Q Developer团队发布两项训练网络安全模型的新方法Cyber - Zero和CTF - Dojo。前者不依赖真实环境生成训练数据,后者构建实战环境让模型学发现漏洞,二者结合为AI白帽黑客成长提供路径。

机器之心
新闻资讯7

刚刚,智谱正式成“全球模型第一股”,开盘涨超3%!10位董事7个清华背景,专家:国内IPO抢收“确定性”,OpenAI们豪赌“无限性”

今天,智谱在港交所正式挂牌上市,成“全球模型第一股”。其有技术、产品、商业化等竞争力,但未盈利,研发投入。专家认为国内模型厂商上市是抢收确定性,而OpenAI等是扩展无限性。

InfoQ
产品应用8

扩散语言模型代码!速度比自回归快10倍

Inception Labs推出基于扩散技术的语言模型Mercury,它突破自回归模型限制,生成速度快,还解决了难以回头调整的问题。实测显示其代码生成速度比传统工具最多快10倍,且有强纠错能力,但面临与当前CI能力不匹配问题。

量子位
新闻资讯7

LeCun离职后不止创一份业!押注与模型不同的路线,加入硅谷初创董事会

离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流模型路线不同,其Kona模型在数独测试上表现远超模型

量子位