多语言推理」共找到 6057 篇相关文章

算法论文8

CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」

新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。

新智元
算法论文8

上海AI Lab提出CANON:让RLVR自主识别优质推理模式

上海AI Lab与上海交大团队提出创新框架CANON,解决将人类先验知识融入RLVR训练的难题。它通过条件分组与对比机制,自适应放大有益指标变化趋势,在数学和逻辑推理任务上成果卓越,还能提升推理效率。

深度学习自然语言处理
产品应用7

规模化人工判断:Dropbox 如何借助大语言模型优化 RAG 系统标注

为提升 Dropbox Dash 生成回复的相关性,工程师采用大语言模型辅助人工标注。该方案解决了纯人工标注的局限,通过人工校准大语言模型标注的方法,为 RAG 系统提供了有价值参考。

InfoQ
算法论文8

沉默的进化:LatentMAS 如何通过“潜意识通信”重塑智能体协作?

这是对智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。

深度学习自然语言处理
开源动态8

腾讯混元AI Infra核心技术重磅开源:推理吞吐提升30%!

腾讯混元AI Infra团队开源生产级高性能LLM推理核心算子库HPC-Ops,基于生产环境痛点开发,降低底层算子开发门槛,实现显著性能突破。在真实场景下,混元、DeepSeek模型推理QPM提升,单算子性能也超越主流算子库。

腾讯技术工程
推荐文章8

模态大语言模型的核心技术架构与训练方法的进化

文章深入剖析模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。

AIGC开放社区
开源动态8

“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式

Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型。

GitHubStore
产品应用8

生产级Prompt自动化推理评估A/B实验结果的工程实践

本文围绕生产级Prompt自动化推理评估A/B实验结果展开,介绍系统背景与痛点,展示主Prompt和决策树,用deepseek - r1等模型推理。通过分析Bad Cases优化Prompt,总结设计原则和迭代方法,还给出通用启示与展望。

阿里云开发者
产品应用7

大规模工程支撑场景下的智能体系统设计:Grab 实践案例

Grab分析数据仓库(ADW)团队推出智能体AI系统,处理数据仓库故障排查等工程请求,减少重复性运维。团队搭建智能体架构,整合工具生态,考虑安全治理,解决上下文管理挑战,提升工作效率。

InfoQ
算法论文8

Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造

Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。

量子位