案例推理」共找到 2323 篇相关文章

算法论文8

模仿学习新范式!Chain-of-Action:轨迹自回归实现动作推理

具身智能领域尚未迎来「GPT时刻」,现有模仿学习范式有缺陷。字节跳动与阿德莱德大学研究者提出「动作链」(CoA)策略,通过轨迹自回归建模解决累计误差,提升泛化性,实验效果显著。

机器之心
算法论文8

Transformer可以改装成Mamba了:苹果把推理成本直接打成线性

苹果将Transformer改造成Mamba,采用‘两步走’策略,先造中间形态,再转成Mamba,避免性能崩塌。实验显示,新方法性能几乎没掉,成本逻辑改变,为模型降本重构提供新可能。

机器之心
开源动态8

老黄入局吃龙虾!英伟达发布最强开源Agent推理模型

英伟达发布并开源120B参数的MoE模型Nemotron 3 Super,在多项测试中表现出色。它原生支持100万token上下文,吞吐量大幅提升。英伟达还计划五年投260亿美元构建开源AI模型,开放全参数权重等。

量子位
推荐文章7

网站GEO技术端优化指南:案例+工具+免费检查清单【转推】

文章指出当前处于传统搜索到AI搜索转型期,Google仍是主流。介绍Google和ChatGPT流程差异,给出抓取、索引、曝光优化建议,还列了该做与不该做之事,并有免费检查清单。

白杨SEO优化教程
算法论文8

西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速

扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。

量子位
算法论文8

AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型

文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。

机器之心
新闻资讯7

Claude两个新模型实测流出!空间推理封神,算力直接榨干了

Claude两款新模型“棉花糖”和“甜瓜”实测流出,在3D强化学习和建筑空间布局上性能强大,还能直接理解并生成复杂3D坐标和空间关系。它们对算力吞噬疯狂,引发对其身份的猜测。

新智元
算法论文8

强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升

人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。

量子位
产品应用8

将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

快手发布新版多模态大模型Keye-VL-2.0-30B-A3B,率先将DSA机制引入多模态理解场景,解锁256K超长上下文深度感知,还首次解锁Agent协作机制。该模型在多方面表现出色,且将融入业务带来收益。

量子位
产品应用7

大规模工程支撑场景下的多智能体系统设计:Grab 实践案例

Grab分析数据仓库(ADW)团队推出多智能体AI系统,处理数据仓库故障排查等工程请求,减少重复性运维。团队搭建多智能体架构,整合工具生态,考虑安全治理,解决上下文管理挑战,提升工作效率。

InfoQ