代码大模型」共找到 9950 篇相关文章

算法论文8

拒绝“熵崩塌”和“熵爆炸”!这项研究让模型学会“精确探索”,推理成绩飙升

2024年以来,模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则化方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。

量子位
算法论文8

从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现模型高效沉默推理

复旦学等机构团队论文提出SIM - CoT技术,解决隐式思维链推理准确率低、不稳定问题。该技术引入步骤级监督,提升性能、效率和可解释性,在多模型和任务测试中表现出色,让模型高效沉默推理。

AIGC开放社区
算法论文8

迎接范式革命:最新、最全的模型Latent Space综述,NUS、复旦、清华等联合出品

模型核心计算正从显式空间转向潜在空间,现有文献缺乏统一视角。NUS、复旦等机构的综述《The Latent Space》从五视角构建框架,阐述潜在空间基础、演进、机制、能力,指出挑战与未来方向。

机器之心
开源动态8

医疗领域DeepSeek时刻:蚂蚁 · 安诊儿医疗模型正式开源,登顶权威榜单

2026 年初,OpenAI 报告显示不少人用 ChatGPT 咨询医疗问题,还发布了 ChatGPT 健康。近日,蚂蚁集团等开源的蚂蚁・安诊儿医疗模型或成最优解,它参数量,在多评测中登顶,技术优势明显。

机器之心
算法论文8

清华首提通用模型滤波方法,实现零样本状态估计|NeurIPS'25

清华学李升波教授团队在NeurIPS 2025提出LLM - Filter通用滤波器,将状态估计融入语言模型推理框架。它能解决传统方法泛化性差问题,在未见过系统中实现零样本状态估计,有望成基础模型

新智元
开源动态8

媲美Claude 4,支持100万上下文!阿里开源超强代码AI Agent模型

阿里巴巴开源超强AI Agent模型Qwen3 - Coder - 480B - A35B - Instruct,测试分数媲美Claude Sonnet 4,超越DeepSeek。它参数多、支持上下文窗口,训练数据优质,还进行代码强化学习扩展训练等,有对应命令行工具。

AIGC开放社区
开源动态8

超越GPT-4o和Gemini 2.5!小米MiMo-Audio音频模型真香

小米推出MiMo - Audio模型,预训练数据超1亿小时。它在多个基准测试成开源7B模型SOTA,开放相关资源。分词器表现佳,有全新架构,在音频理解、对话、推理等方面表现出色,还集成TTS功能。

AIGC开放社区
算法论文8

ICLR 2026 | 别再让模型“想太多”了!最新研究揭示 LLM 推理效率的关键瓶颈

语言模型推理计算成本失控,存在过度与思考不足问题。研究揭示推理失衡是根源,提出BAM模型及Plan - and - Budget框架,实验显示其能提升准确率与效率,转向‘推理价值’范式。

机器之心
算法论文8

多模态模型中Attention机制暗藏「骗局」,需用一个公式修正丨上×南开

上海学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。

量子位
新闻资讯8

官宣!前 OpenAI 华人科学家姚顺雨加入腾讯,模型“系统战”开启!

12月17日消息,前OpenAI科学家姚顺雨加盟腾讯,任首席AI科学家等职。他是AI Agent与模型推理领军人物,其加入是腾讯AI补强。腾讯还新成立三部门,标志战略向系统化工程建设进阶,混元也有不错表现。

AI科技大本营