「强化学习框架」共找到 2865 篇相关文章
哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理
哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。
第二代InfLLM开源,同尺寸快三倍!零参数,可训练稀疏注意力
新智元报道,清华、OpenBMB和哈工大提出零额外参数、训练高效的原生稀疏注意力框架InfLLM-V2,仅用5B长文本词元就能完成训练,相比稠密注意力机制有显著加速,性能接近传统稠密模型。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
用超图撕开知识边界:16万节点无师自通搞Agentic科研
传统知识图谱只能用三元组描述世界,难以应对真实科学场景里的多体交互。作者提出将文献里n元关系存成超图超边,让LLM在多智能体框架里‘沿着超边走路’,并构建了超图进行实验,实现可验证的科学发现。
数据合成篇|多轮ToolUse数据合成打造更可靠的AI导购助手
文章以租赁导购助理“小不懂”为例,介绍Tool Use训练数据合成方案。先分析训练数据的目标与难点,提出动态多智能体对话生成框架,阐述多轮数据、复杂问题合成及过滤方案,展示数据和模型效果,还提及未来工作方向。
林俊旸离职后首度发声:万字复盘,大模型下一站「智能体式思考」
前阿里千问负责人林俊旸离职后发文,复盘大模型行业演进,指出 AI 大模型未来主线是智能体式思考。文中分析推理模型崛起的启示,探讨思考与指令融合难题,还阐述智能体式思维含义、强化学习基础设施挑战等。
推荐系统进入「双动力」时代!首篇LLM-RL协同推荐综述深度解析
强化学习是推荐系统主流建模范式,但传统 RL 推荐系统有诸多瓶颈。大语言模型崛起带来新机遇,LLM 与 RL 结合开启新范式。研究团队发布首篇相关综述,提出五大协同范式,总结评估体系,分析挑战与方向。
华为版CUDA,全面开源了
华为宣布为昇腾AI GPU开源CANN软件工具包及Mind系列套件、工具链,让昇腾更好用。CANN类似华为版CUDA,目前到8.0版,支持多深度学习框架。同日,传奇GPU架构师创业公司浮出水面,挑战英伟达。
全球首个IMO金牌AI诞生!谷歌Gemini碾碎奥数神话,拿下35分震惊裁判
谷歌DeepMind官宣Gemini Deep Think在IMO获官方认证金牌,4.5小时解5题得35分。它用纯英语解题,结合并行思考与强化学习训练。谷歌后续将向部分测试者及订阅者推出模型,还公开了解题过程。
刚刚,OpenAI 发布了GPT-5 前菜:ChatGPT Agent
OpenAI发布ChatGPT Agent,它是统一智能代理系统,融合多种功能与工具,能动态选处理路径。在多测试中表现佳,采用强化学习微调新架构。使用体验似与人协作,OpenAI采取安全措施,还探索商业、分批开放,业内看法不一。