强化学习方法」共找到 687 篇相关文章

新闻资讯8

见证历史!DeepSeek跃居全球第二AI实验室,R1登顶开源王座,R2全网催更

昨晚,DeepSeek官宣R1完成小版本升级,开启「深度思考」功能可体验。其R1-0528性能媲美o3和Gemini 2.5 Pro,还微调了8B模型。DeepSeek成全球第二大AI实验室和开源王者,网友催更R2。

新智元
算法论文8

TRM思考奖励模型上线,大模型推理质量终于能量化了 | ICML‘26 Oral

大模型推理评测多只看答案,忽略推理过程。上海多校团队提出TRM,用ME² principle刻画推理质量,DAG-based pairwise evaluation还原结构,训练奖励模型,让推理质量可度量、训练和优化。

量子位
开源动态8

35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源

5月15日上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,尺寸小、科学能力强,在多方面有突破。其深化与昇腾算力生态协同,探索‘通专融合’,科学及智能体能力升级,还优化训推效率。

GiantPandaLLM
推荐文章8

白春礼:人工智能促进科学研究范式变革

白春礼在浦江论坛探讨AI对科研范式变革的影响。他指出,当下科学研究体系面临发现机制、组织方式、知识生产方式的结构性重组,呈现新特征,同时也面临竞争、组织变革等挑战。

力学与人工智能
新闻资讯7

创业7年干出一个全球第一,这家深圳芯片公司冲刺港股IPO

曦华科技冲刺港股IPO,其2024年scaler芯片出货量全球第二,ASIC架构scaler产品市场份额达55%排第一。不过,公司仍亏损,且面临激烈竞争。它靠产品创新和高研发投入提升估值,后续有应对竞争的规划。

芯师爷
新闻资讯7

赛力斯上市,可能是“脱离华为”的关键一步|甲子光年

2025年11月5日,赛力斯在港交所挂牌上市,募资净额140.16亿港元。赛力斯上市旨在强化单独造车能力,70%募资用于研发。其魔方技术平台待完善,赛力斯居安思危,或为脱离华为做准备。

甲子光年
新闻资讯7

Meta裁员后续:田渊栋被过河拆桥,姚顺雨等集体「抢人」

Meta在人工智能部门裁减约600个职位,田渊栋团队被裁,原因众说纷纭。此次裁员或为强化Alexandr Wang核心地位,也反映Meta内部研究架构混乱。同时,引发AI公司“抢人大战”。

机器之心
推荐文章7

听说,大家都在梭后训练?最佳指南来了

大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。

机器之心
新闻资讯7

GPT-5 最强大的,是编程

据报道,OpenAI的GPT - 5即将到来且早期反馈积极。它在编程领域表现突出,尤其在实际编程任务上有提升,不过其具体形式存疑,改进或多来自后训练阶段的强化学习。

AGI Hunt
新闻资讯7

OpenAI 内部访谈流出:新 Agent 强到让我们害怕,已接近“自我进化”的边缘!

红杉资本访谈 OpenAI 打造新款 ChatGPT Agent 的核心成员。介绍 Agent 结合多工具、共享状态,能执行复杂任务。还谈及起源、训练方法、应用场景,以及安全挑战和未来规划等。

探索AGI