跨语言推理」共找到 3090 篇相关文章

算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
算法论文8

该工作引来马斯克回复,让Gork破防:CoT是真正的推理,还是训练数据的统计插值?

大型语言模型(LLMs)的思维链(CoT)推理能力被视为突破性进展,但论文揭示CoT可能只是数据分布内的模式匹配幻象,通过实验证明其在分布偏移时表现急剧退化,挑战主流认知。

深度学习自然语言处理
开源动态7

Claude 小升级就赢了OpenAI 9年“开源神作”?高强度推理直接歇菜、幻觉率高达50%,写作还被Kimi 2吊锤?

OpenAI发布首个开源语言模型系列gpt - oss,包括gpt - oss - 120b和gpt - oss - 20b,可在Hugging Face下载。同期谷歌、Anthropic也有新模型推出。gpt - oss有亮点,但也存在幻觉率高、实测效果差等问题。

InfoQ
产品应用7

对话 MoonBit 张宏波:为 AI 重构编程语言

文章围绕 MoonBit 语言开发者张宏波展开,探讨为 AI 重构编程语言。指出当前 AI Coding 基于旧有语言有局限,MoonBit 有原生 AI 支持,还介绍其开发历程、特性及 Pilot 工具创新,强调未来商业化愿景。

AI科技评论
开源动态8

「百万级」视频推理数据集!30+顶尖高校联合发布

AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。

新智元
新闻资讯7

OpenAI自曝:AI推理砸钱越多,碾压人类越狠!

OpenAI研究员探讨推理模型时代。Noam Brown强调预训练和推理范式,指出当前AI胜在通用性。推理范式成本低、效果好,如o系列模型表现出色。首席经济学家谈AI经济影响,称其重塑企业格局。

新智元
算法论文8

DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%

特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。

量子位
开源动态8

华为| 祭出FlashComm1,FlashComm2、FlashComm3,解决LLM推理通算瓶颈

在大模型推理面临通算难题背景下,华为数学家祭出FlashComm 1、2、3。如FlashComm 1优化AllReduce通信,提升推理性能;FlashComm 2重构计算流程,提升推理速度;FlashComm 3实现多流并行,激增模型吞吐。

AINLPer
算法论文8

从「记忆解题」到「深度推理」:港科大推出首个本科数学动态评测基准 UGMathBench

港科大团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营
产品应用7

别再无脑开高推理!Opus 5高配会擅自重构代码乱加戏

有人用FrontierCode编程基准测试Opus 5推理档位,发现性能顶峰在medium档,高档位推理预算多余,会让模型反复校验、偏离需求,在代码场景还会擅自重构代码。Anthropic也建议调低推理档位。

量子位