「模型能力提升」共找到 9801 篇相关文章
12.1万高难度数学题让模型性能大涨,覆盖FIMO/Putnam等顶级赛事难度,腾讯上海交大出品
腾讯AI Lab与上海交大团队联合推出首个基于自然语言的数学定理证明框架与数据集DeepTheorem。12.1万道高难度数学“特训题”让模型定理证明性能大涨,7B模型性能比肩或超越现有开源和商业模型。
DeepSeek-R2尚未问世,微软小模型捡漏称王?6000样本炼出「数学作弊器」!
微软推出Phi-4推理模型系列,参数最多14B,能在本地高性能笔记本电脑上流畅运行。Phi-4-mini-reasoning在数学推理上性能超越DeepSeek-R1蒸馏模型,且参数规模更小。文章还介绍了模型特点、训练方法、性能表现及局限性等。
ROLL:面向大规模语言模型的高效强化学习框架
本文介绍阿里推出的ROLL强化学习框架,专为LLM训练优化。它设计灵活,不同用户可用其满足业务、探索或线上指标需求。在多任务训练中性能出色,还采用创新机制提升效率,支持自定义操作,适合学术和业务场景。
告别「盲目自信」,CCD:扩散语言模型推理新SOTA
华为小艺香港团队等研究人员提出上下文一致性解码算法(CCD)。它解决传统DLM推理“短视”和采样预算固化问题,在开源DLMs上实现3.48倍加速和3.9%性能提升,适配多种解码设定。
无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%
西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。
DeepSeek涨价,OpenAI降价,Agent改写了大模型价格战
近期,DeepSeek上调API价格,V4 Pro等型号涨幅明显;而OpenAI的GPT - 5.6 Luna API价格降80%,Terra降20%。这背后是大模型价格竞争方向转变,受竞争、广告、效率及Agent使用方式等因素影响。
姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”
姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。
我MiniMax,用实习生处理数据,照样屠榜开源大模型
MiniMax M2屠榜开源大模型,引发社区热议。它在注意力机制、数据处理、思考模式上另辟蹊径,公开技术细节。M2团队选Full Attention,雇实习生处理数据,提出交错式思维链策略,强调实用性和泛化能力。
刚刚,美团推出 136 亿参数视频生成模型
美团推出 136 亿参数视频生成基础模型 LongCat-Video,采用 MIT 开源协议。该模型覆盖文本、图像生成视频及视频续写三类任务,能生成分钟级长视频。效率高,评测数据表现佳,安装和运行简便,引网友惊叹。
Lumina-DiMOO:多模态扩散语言模型重塑图像生成与理解
上海人工智能实验室推出多模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破多模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在多项评测中夺魁。