代码大模型」共找到 10013 篇相关文章

算法论文8

国科 | 提出进化算法:EvolKV,自适应分配KV Cache,预算降至1.5%!

键值缓存(KV cache)是模型快速运行核心技术,但输入文本越长,存储和处理问题越突出。国科提出进化算法EvolKV,自适应分配KV Cache,实验显示其效果显著,预算可降至1.5%。

AINLPer
新闻资讯7

GPT之父:只用上世纪数据训AI,它居然也会写Python?!

GPT之父Alec Radford团队训练出talkie - 1930 - 13b模型,其训练数据截止1931年。该模型能说新政立法、写Python代码。团队还对比其与现代模型,发现核心能力差距不,且用老语料调教它成聊天助手时现风格问题。

量子位
算法论文8

首次结合RL与SFT各自优势,动态引导模型实现推理⾼效训练

新一代型推理模型在复杂推理有进展,核心是ZERO - RL训练法。华为香港研究所小艺团队等合作推出GHPO算法框架,融合在线强化学习与模仿学习,解决了RLVR方法局限,提升模型训练效果,代码数据开源。

机器之心
算法论文8

ACL 2026 | 中科&上海AILab揭示强化学习后训练的Scaling Law

中国科学技术学和上海人工智能实验室等团队,在Qwen2.5和Llama 3模型开展研究,揭示强化学习后训练的Scaling Law,提出幂律公式预测模型学习效率与训练轨迹,成果被ACL 2026接收。

机器之心
新闻资讯7

悬赏5000刀!148局AI斗蛐蛐世界杯官方战报出炉,全球赛邀你接棒来战

淘宝举办AI模型斗蛐蛐世界杯,将12个顶尖模型放同一Agent框架,在12人局技能狼人杀场景对战150局。截至148局,谷歌两模型暂居前二,Qwen3-Max-2026-01-23排第三。还开启WhoisSpy国际赛,开发者可参与,前十有奖励。

量子位
开源动态8

刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking

美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。

AGI Hunt
开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

多图像、长视频让型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位
产品应用9

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

本文深度解读DeepSeek最新发布的V4.1 Flash模型,详解其全新CED架构与第二代压缩稀疏注意力CSA2,揭秘其通过架构创新幅压缩KV缓存、降低显存算力成本,在长上下文Agent场景实现性能反超的细节。

AI科技评论
算法论文8

一个模型装下整个物种树!伯克利GPN-Star斩获基因预测双料冠军

加州学伯克利分校等机构推出基因组语言模型GPN - Star,可将全基因组比对和物种树信息装进模型。它克服传统GLMs短板,实现三点升级,在多基准测试表现出色,是强的全基因组变异解读框架。

新智元
开源动态8

识别1600+种人类语言,支持少样本扩展到5400+种语言,Meta自动语音识别模型开源

Meta AI发布Omnilingual ASR自动语音识别模型并开源。它能转录超1600种语言,含500多种首次被AI理解记录的语言,还可通过少样本扩展到5400多种,改变了多语言ASR构建范式。

AIGC开放社区