中国大模型」共找到 9572 篇相关文章

算法论文8

模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!

Qwen团队、清华和南洋理工研究打破传统认知,揭示‘对齐税’现象。提出Confident Decoding策略,在多架构和评测集实验中表现出色,开销低,挑战‘LLM最后一层最优’常识。

量子位
算法论文8

自回归模型杀回图像生成!实现像素级精准控制,比Diffusion更高效可控

当下AI图像生成领域,Diffusion模型虽为主流,但在精准控制上有不足。伊利诺伊学香槟分校等机构研究者提出MENTOR框架,用自回归模型实现像素级精准控制,比Diffusion更高效可控。

量子位
7

硅谷的「十万裁员」:Meta按代码量裁员

2025年,AI浪潮席卷硅谷,引发新一轮裁员潮。从互联网巨头到初创企业,纷纷边裁边招,将资源转向前沿模型。基层岗位被自动化压缩,顶尖AI人才需求飙升,裁员是职位版图重塑的前奏。

新智元
算法论文7

模型“记性差一点”反而更聪明!金鱼损失随机剔除token,让AI不再死记硬背

马里兰学等团队提出金鱼损失法,训练时随机剔除部分token,让模型不逐字记内容,仍学语言规律。实验显示,LLaMA - 2用该方法后记忆内容减少,下游任务性能影响小。

量子位
算法论文8

港科&北京人形提出LOVON:足式机器人开放世界全域目标追踪新范式!

港科广州联合北京人形创新中心推出LOVON框架,融合语言模型、开放词汇视觉检测和语言 - 运动映射模型,解决足式机器人开放世界全域目标追踪难题,有抗干扰视觉处理等优势,性能超传统方法。

机器之心
算法论文8

GRPO遭遇瓶颈?G²RPO-A让自适应指导为小模型推理能力「开外挂」

模型推理能力难迁移到小模型,现有强化学习方法如GRPO在小模型上性能提升有限。香港中文学(深圳)唐晓莹教授团队提出G²RPO - A算法,缓解小模型奖励稀疏问题,在多模型实验中表现优于vanilla GRPO。

机器之心
新闻资讯8

腾讯AI战略升级:组织架构重组与混元世界模型1.5发布

2025年12月17日,腾讯宣布两项重举措,一是重组AI组织架构,成立新部门并任命首席AI科学家;二是发布混元世界模型1.5,能实时生成可交互3D虚拟世界,应用场景广泛,或引领行业进入‘AI原生’新阶段。

MCP Lab
开源动态8

Yann LeCun放出憋了20年的招:Meta开源V-JEPA 2世界模型

Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。

AGI Hunt
推荐文章8

阿里云CIO首次系统复盘:模型落地的 RIDE 方法论与 RaaS 实践突破

阿里云智能集团 CIO 蒋林泉分享模型落地实践,指出企业中业务与 IT 对 AI 认知矛盾突出。他展示阿里云数字人落地成果,提出 RIDE 方法论,还剖析翻译和 Agent 两种应用模式及落地要点。

AI前线
算法论文8

DPad: 扩散语言模型的中庸之道,杜克学陈怡然团队免训推理加速61倍

扩散语言模型(dLLMs)有全局规划能力,但存在计算冗余。杜克学陈怡然团队揭示其“草稿纸机制”,提出免训练方法DPad,结合现有技术,能在几乎无损精度下实现高达61.4倍推理加速。

机器之心