强化学习训练」共找到 3134 篇相关文章

产品应用8

比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一

昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。

机器之心
开源动态8

10B超越Gemini-2.5-Pro!阶跃星辰端侧多模态天花板开源

阶跃星辰多模态智能团队开源STEP3-VL-10B多模态模型,仅100亿参数却性能惊人。它采用了独特的架构、训练策略与推理机制,在多任务上表现出色,为小模型发展提供新思路。

AIGC开放社区
算法论文7

The Batch: 899 | 更划算的推理

研究人员提出 Delethink 强化学习方法,训练大模型定期截断推理 token 至固定最大数量,以限制处理长思维链成本。经测试该模型在多方面超基线,且缓解计算成本限制,为长上下文推理提供路径。

DeeplearningAI
开源动态8

国产AI拿下国际物理奥赛金牌,13项顶级竞赛豪取12金1银,划重点:开源

上海人工智能实验室团队推出开源模型家族P1,在IPhO 2025理论考试中,P1-235B-A22B成首个达金牌线的开源模型。引入PhysicsMinions后成绩提升,在HiPhO基准排名第一,且全链路开源。

量子位
新闻资讯7

英伟达可能要给这个 AI Coding 投 10 亿美金,AI 提升电商交易每月增长 100% 的一个典型案例

Bloomberg消息称英伟达或向Poolside投5 - 10亿美金,该轮融资20亿,估值达120亿。Poolside由Github前CTO创立,从AI Coding产品转型基础模型公司,欲通过软件开发实现AGI,还提到AI在电商二手商品售卖的应用。

投资实习所
开源动态8

HumanSense:探索多模态推理边界,打造「察言观色会共情」的全模态交互伙伴

蚂蚁集团与西安交通大学联合提出并开源 HumanSense,含评估基准与推理模型。通过细粒度评测、全模态消融等研究,提出优化策略,项目已在 GitHub 和 HuggingFace 开源,推动 AI 交互体验革新。

机器之心
新闻资讯7

刚刚!Thinking Machines Lab | 长文揭开LLM推理不确定性真相!

Thinking Machines Lab发布《克服LLM推理中的不确定性》,揭示大语言模型推理不确定性原因,并非“并发 + 浮点”假设那么简单,主要是负载及batch size不确定所致,还给出让核函数有批次不变性的方法及实验结果。

AINLPer
开源动态8

重磅!Thinking Machines开山之作:大模型输出随机的根本原因被揪出,并开源终结方案

由OpenAI前CTO创办的Thinking Machines宣布上线技术研究博客,开篇文章揪出LLM输出随机的根本原因是负载及批次大小的非确定性变化,并给出系统性解法,还开源方案。

AI寒武纪
开源动态7

从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路

OpenAI 近日发布 gpt-oss-120b 和 gpt-oss-20b 两个开源模型,Sebastian Raschka 发布博客对其详细分析,回顾自 GPT - 2 以来 AI 社区进步,还与 Qwen 3 比较,介绍架构、训练、推理等细节。

机器之心
推荐文章7

深入剖析AI公司正在面临的:「囚徒困境」

文章指出AI模型训练成本虽下降,但运营成本尤其是推理费用飙升,使AI公司陷入两难。用户只青睐最强模型,且模型资源消耗远超预期,订阅模式难以为继,还给出了避免亏损的三条出路。

AINLPer