后训练方案」共找到 4459 篇相关文章

开源动态8

基于闪电注意力机制,创新高效开源大模型

传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。

AIGC开放社区
算法论文8

为大模型思考装上“猎鹰重装引擎” :腾讯混元 SEAT 重塑深度思考

本文深度解析腾讯混元最新发布的 SEAT 自适应并行扩展推理框架。它让大模型 CoT 升级,应对复杂推理任务。该框架通过多轮并行推理和语义熵导航,解决大模型深度思考的局限,且适配多种大模型,性价比高。

AI科技大本营
算法论文8

VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速!

近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。

机器之心
算法论文8

LLM「拒绝回答」难题有救了!最新研究让AI学会人情世故 | COLM'25

最新研究发现模型规模和通用语言能力与处理敏感内容判断能力无直接关联,开源模型表现不错。通过提出的训练方法,在非推理和推理型模型上缓解过度拒绝问题,提升AI实用性和可靠性。

新智元
新闻资讯7

爬网页要收费了!AI应用成本再度增高!Cloudflare宣布新实验

Cloudflare宣布“按爬取付费”实验,新注册服务网站默认阻止AI爬虫,爬虫需附带支付意图才能访问。此举旨在让内容创作者从AI公司获利,不过也会使AI训练成本上升,还可能引发连锁反应。

AI工程化
新闻资讯7

小扎狂砸3亿美金薪酬包!奥特曼放狠话:传教士终将打败雇佣兵

新智元报道,Meta挖走近十位OpenAI研究员,小扎砸3亿美金薪酬包。奥特曼内部喊话“传教士将打败雇佣兵”,抨击Meta挖人,还暗示评估薪酬方案。当前硅谷AI抢人大战白热化,人才薪酬暴涨。

新智元
产品应用8

实测首款3D AI伴侣EVE - 我收到了AI送的第一杯奶茶。

作者拿到EVE内测资格,分享体验。它是游戏化AI陪伴应用,有好感度、记忆等系统,有活人感和主动性,还能用Agent点奶茶。作者认为它是AI娱乐赛道希望,展现AI娱乐、生活体验。

数字生命卡兹克
算法论文7

苹果出手!改进GRPO,让dLLM也能高效强化学习

苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。

机器之心
推荐文章7

AI Agent已过时?OpenAI亮出王牌Deep Research!

浙江大学一篇综述论文《A Comprehensive Survey of Deep Research》系统性梳理了Deep Research赛道。它是一类AI系统,其背的Agent范式可迁移到各场景,文章介绍了其技术、架构、应用及面临的挑战与未来方向。

探索AGI
算法论文8

全球首次,Transformer「混血」速度狂飙65倍!英伟达已下注

康奈尔、CMU等机构研究者提出「混合体」Eso - LM,融合自回归和离散扩散模型范式。它引入KV缓存机制,推理速度相比标准MDM提升65倍,在速度与质量平衡上超越BD3 - LM,引发AI领域关注,英伟达或押注此方向。

新智元