代码大模型」共找到 9950 篇相关文章

算法论文8

清华唐杰团队揭示模型记忆全景

清华唐杰教授团队等发布模型记忆架构综述,提出三维记忆分类学,将前沿工作统一到理论框架,为LLM设计指明方向,分析了隐式、显式记忆架构,还探讨混合架构挑战与未来方向。

量子位
开源动态8

SimpleTIR:让模型“边写代码边思考”不再崩溃

SimpleTIR可解决多轮工具调用中训练崩溃问题。作者指出崩溃原因是分布偏移、低概率token链式雪崩和梯度爆炸。它采用void turn过滤,掐断崩溃链路,训练稳定,还催生多样推理行为,且工程友好已开源。

AI科技评论
算法论文8

模型异步地增强推理能力

模型推理时代,Test - Time Scaling成提升能力重要方向,但面临效率问题。ATTS提出异步框架,加入共形预测筛选候选路径,实验显示其加速显著,将测试时扩展推进到‘有原则加速’阶段。

深度学习自然语言处理
新闻资讯8

语言模型 + 编程智能体 = 安全噩梦

作者结合黑帽会英伟达演讲,指出语言模型和编程智能体扩攻击面。如攻击者利用公共资源留恶意指令,实施水坑攻击。强编程智能体虽普及,但易造成安全漏洞,虽有防御措施但效果有限。

宝玉AI
新闻资讯7

玻尔兹曼入住南京模型产业集聚区

玻尔兹曼宣布入驻南京模型产业集聚区。虽24年拿牌照后营收不及预期,上半年业务失利,但反思发现产品力尚可,只是运营推广欠佳,后经与投资人交流及自我思考,坚定业务发展信心。

Agent的潜意识
算法论文7

一篇多模态模型推理技术最新综述

华东师&字节跳动系统回顾基于强化学习的MLLMs推理进展,涵盖关键算法设计、奖励机制创新及实际应用,探讨了RL在LLMs/MLLMs中的关键设计与优化策略,还涉及多模态模型推理多方面内容。

PaperAgent
新闻资讯8

AI圈“集体开”!DeepSeek、Claude带头,智谱、阿里、蚂蚁、智源都“卷”起来了

双节前最后一天,AI圈“卷”疯了!智谱发布并开源GLM - 4.6,是国内最强Coding模型;阿里介绍视、听、说全模态同传模型Qwen3 - LiveTranslate - Flash;蚂蚁开源万亿参数推理模型Ring - 1T - preview;智源开源跨本体基座模型RoboBrain - X0。

AI科技大本营
开源动态7

从文心开源谈起,论模型发展新生态

6月30日百度宣布开源ERNIE 4.5即文心4.5系列模型,实现预训练权重+推理代码完全开源。文心团队提出创新架构,增强多模态理解能力。今晚7:30,CSDN邀专家深度解读文心开源及行业趋势。

AI科技大本营
新闻资讯7

“龙虾”时代,模型公司的好日子来了

3月10日,MiniMax港股收涨,市值超百度。OpenClaw爆火,其创始人转发评测榜单,使MiniMax-M2.1排名突出。OpenClaw是智能体构建框架,为模型公司带来盈利转机,撬开收入天花板,引发各方关注。

远川科技评论
算法论文8

Anthropic:模型开始意识到自己在想什么!

Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。

深度学习自然语言处理