「带可验证奖励的强化学习」共找到 1547 篇相关文章
中国移动副总经理陈怀达:AI时代,真正的竞争力不在于单一技术的领先
10月19日,中国移动副总经理陈怀达在2025世界VR产业大会演讲指出,VR与AI深度融合,‘AI+’时代有‘三个加速融合’趋势。他还提出关注方向,分享了中国移动‘VR+AI’融合发展体系实践。
Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”
来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。
刚刚,Andrej Karpathy放出大招:开源nanochat项目,仅8000行代码100美元就能训练出一个ChatGPT
Andrej Karpathy发布nanochat项目,用8000行代码实现ChatGPT完整训练流程。在8xH100节点跑4小时、花100美元,就能有对话、写故事、答题的AI助手。项目覆盖广,含多训练步骤及评估体系。
UserBench 与 UserRL 带来的交互智能范式转向
当下大模型在与用户交互时存在不足,来自UIUC与Salesforce的UserBench和UserRL两篇新作,将‘用户价值’量化,把‘可测的交互’转化为‘可训练的策略’,从评测和训练层面推动模型向‘懂用户’转变。
DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day0官宣支持适配
DeepSeek v3.2开源TileLang版本算子引关注,其可对标CUDA替代Triton,还适配国产算力生态,华为昇腾官宣支持。TileLang由北大团队主导,提供不同层次编程接口,助DeepSeek提升性能。
Mini-Omni-Reasoner:实时推理,定义下一代端到端对话模型
现有端到端对话模型推理能力未解锁,因深度思考带来延迟。为此提出 Mini - Omni - Reasoner,采用边思考边表达范式,突破‘要么快,要么准’困境,还设计了数据合成管线和五阶段训练方法,实验证明其性能提升明显。
蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理
医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。
刚刚!OpenAI训练GPT-4b攻克诺奖级“细胞再生”难题:效率狂飙50倍,连DNA损伤都能修复
OpenAI联手Retro Biosciences研发GPT - 4b micro用于蛋白质工程,让诺奖级细胞再生技术效率提升50倍,设计的新蛋白质还有DNA损伤修复功能,结果在多方面获验证。
抄作业了!让AI产品告别“上线就崩”的CC/CD框架,6步搞定,拿走不谢。
文章指出AI产品因大模型不确定性,易上线翻车。介绍海外流行的CC/CD开发框架,阐述AI产品不确定性原因,强调自主与控制平衡,还给出该框架落地的6步工作流。
用“蒸汽机”生成视频,还能音视频一体化交付?
8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。