推理策略」共找到 2761 篇相关文章

算法论文8

AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o

斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。

量子位
开源动态8

更大,还能更快,更准!蚂蚁开源万亿参数语言模型Ling-1T,刷新多项SOTA

10月9日,蚂蚁开源万亿参数语言模型Ling-1T。它延续自研高效MoE架构,在编程、数学推理等多维度测试表现亮眼,还能兼顾精确与效率。此外,它在多场景实用性强,其创新设计提升了能效比与性能。

机器之心
产品应用8

文库 GenFlow 2.0,如何把 AI Agent 卷成“专家级”?

百度启动文库与网盘AI重构工程,8月18日GenFlow2.0发布。它生成的报告格式专业,能让用户实时干预任务运行,HTML在线报告交付体验好。其靠100多个专家Agent工作,构建了清晰产品层次和分层策略

特工宇宙
算法论文8

ICCV 2025 | EPD-Solver:西湖大学发布并行加速扩散采样算法

扩散模型成生成任务主流技术,但逐步去噪机制致推理延迟大。西湖大学提出 EPD - Solver 算法,融合三类加速思路优势,可减少积分误差、提升生成质量,还能作插件集成,突破扩散模型速度与质量权衡瓶颈。

机器之心
新闻资讯7

Kimi K2里找到了DeepSeek V3架构

Kimi新模型K2热度高,在多benchmark上达SOTA,网友好评多。Kimi工程师透露K2开源原因,还谈及Kimi发展策略。实测显示K2在前端制作、工具调用、创意写作上表现出色。此外,OpenAI开源模型推迟,引发猜测。

量子位
新闻资讯8

OpenAI深夜数连发:o3降价80%,o3-pro上线,奥特曼最后一次手发长文,开源模型却延期了……

OpenAI昨夜动作不断,o3模型降价80%,o3 - pro发布,开源模型延期。Sam Altman发长文《温和奇点》,预测AI发展时间线。o3价格虽降但使用成本仍有差异,o3 - pro性能强却推理慢,开源延期引发猜测。

AGI Hunt
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
推荐文章7

深度剖析将 Kafka 构建在 S3 上的技术挑战与最佳实践

文章基于AutoMQ深入剖析将Kafka构建在S3上的挑战与解法。探讨延迟、IOPS、缓存管理等问题,介绍AutoMQ应对策略,如用WAL+S3架构降低延迟、批处理数据减少请求等,还提及Kafka兼容性及跨区流量成本处理。

InfoQ
算法论文8

Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好

Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

量子位
算法论文8

10行代码,AIME24/25提高15%!揭秘大模型强化学习熵机制

来自多机构的研究者揭示大模型强化学习中熵变化机制。发现策略熵在训练中急剧下降致性能停滞,提出 Clip - Cov 与 KL - Cov 两种正则化技术调控高协方差标记,遏制熵塌缩,在部分数据集上性能提升显著。

机器之心