大模型强化学习」共找到 8376 篇相关文章

算法论文8

ICLR 2026!代码优化不再靠玄学:大模型真正学会“又快又准”,效率提升71.06%,加速比达6.08x

ICLR 2026顶会文章提出全新大模型代码优化方案,切入代码优化核心难题。该方案将代码优化率提至71.06%,加速比达6.08x,正确性提至74.54%,有很强工程可用性。

AINLPer
算法论文8

腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式

过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。

AI科技评论
开源动态8

训练效率提升25%、成本降23%!上海期智研究院、算秩未来联合推出MegatronApp:专为万亿参数大模型训练打造的系统工具包

上海期智研究院联合算秩未来在WAIC 2025大会发布开源项目MegatronApp,它是国内首个围绕Megatron - LM的增强工具链。经实际数据,其在该框架下训练效率提25%、成本降23%,含四大模块解决训练难题。

AI前线
8

超越英伟达B200!AMD最强AI芯:1.6倍大内存、大模型推理快30%,奥特曼都来站台

AMD发布最强AI芯片MI350X和MI355X,号称大模型推理比英伟达B200快30%,内存是其1.6倍。该系列本月初已批量出货,还发布ROCm 7软件栈。AMD还预告明年推MI400系列,由其与OpenAI联合研发。

量子位
推荐文章7

当面试官说「回去等通知」时,他们到底在等什么?

Chip Huyen的开源书《Machine Learning Interviews》被热议,其用200+道题拆解机器学习面试真相,指出多数人挂在三环节。书还摊开不同岗位考察点,建议关注解题路径,还给出资源指路。

AI工程化
新闻资讯8

更全面的具身智能真机评测来了!CVPR 2026 ManipArena挑战赛邀你打榜

具身智能产业发展迅速,但缺统一、高标准真机评测体系,成发展痛点。中山大学等机构推出 ManipArena 挑战赛,提供科学评测框架,已测部分模型,揭示不同技术路线能力边界,为产业发展提供基础。

机器之心
产品应用8

Anthropic新模型杀疯了!成本直降 2/3、性能直逼GPT-5,用户实测:比“吹”的还强,速度超 Sonnet 3.5 倍

Anthropic发布Claude Haiku 4.5版本,成本降2/3、性能逼近GPT - 5,速度超Sonnet 3.5倍。该模型已全平台上线,可处理大文件,安全对齐性佳。它能与Sonnet协同,适用于企业与软件开发,Anthropic业务也在爆发式增长。

InfoQ
新闻资讯7

OpenAI重组GPT-5「灵魂」团队!亚裔女负责人遭调离,罕见自曝AI幻觉祸首

OpenAI进行重磅结构调整,ChatGPT「模型行为」团队并入Post - Training,前负责人Joanne Jang负责新OAI Labs。同时,OpenAI揭秘AI产生「幻觉」的罪魁祸首是「应试」评估体系。

新智元
算法论文8

ICLR 2026 Oral | 告别多步去噪!清华团队推出MVP,实现机器人动作单步极速生成

清华大学智能驾驶课题组 iDLab 与加州大学伯克利分校人工智能研究院 BAIR联合发表研究,提出 MVP 策略。它引入瞬时速度约束解决均值流学习问题,设计复合生成与选择机制,在多任务测试中表现出色。

机器之心
新闻资讯7

扩散不死,BERT永生!Karpathy凌晨反思:自回归时代该终结了?

苹果前员工Nathan Barry得出BERT本质是文本扩散一步的结论,将表示学习算法改造成生成算法。OpenAI创始员工Karpathy对此沉思,认为生成逻辑在LLM架构中可变。实验证明RoBERTa可转为生成引擎。

新智元