多任务强化学习」共找到 3203 篇相关文章

算法论文8

一篇大模型Agentic框架到应用最新综述

这是首篇系统拆解“大模型Agentic推理框架”的综述,不聊训练,只聚焦如何把LLM组织成会思考、协作、调工具的Agent,横跨科学发现、医疗、软件工程、社会经济模拟四大战场,给出统一语言、视角和评测。

PaperAgent
新闻资讯8

Sora2甚至可以预测ChatGPT的输出

Sora2表现太卷,能预测ChatGPT输出,模拟交互还能渲染HTML,懂代码也懂物理,能体现玻璃折射现象,还能精准还原游戏支线任务关键要素,或基于LLM训练。

量子位
产品应用8

科幻!谷歌放出Gemini Robotics-ER 1.5:机器人有了真正的思考力

谷歌推出首个广泛开放给开发者的机器人具身推理模型Gemini Robotics - ER 1.5,可作为机器人高级推理大脑。它能解决物理问题,有新能力如快速空间推理等,还能让开发者平衡延迟与准确性。

AI寒武纪
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。

机器之心
开源动态7

最好的 DeepResearch 平替开源了

ROMA是元代理框架,以递归分层结构解决复杂问题,有并行问题解决、透明开发等优势。它通过计划 - 执行循环处理任务,介绍了安装选项、技术栈,还有预构建代理展示功能。

GitHubStore
新闻资讯7

忘掉大模型,微软实证:小模型才是Agentic AI的未来!

过去两年大模型在数学竞赛题上靠Test - Time Scaling发展遇天花板。微软rStar2 - Agent让14B小模型学会‘写代码→跑结果→改思路’,表现出色。还介绍了其基础设施、算法、训练配方等方法。

PaperAgent
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。

PaperAgent
新闻资讯7

OpenAI宣布推出AI在线招聘平台,和微软的领英打起来了

OpenAI计划2026年推出AI在线招聘平台OpenAI Jobs Platform,借助AI匹配企业需求与员工能力,将与微软领英竞争,还与多机构合作,同时扩展学习平台并推认证课程。

量子位
开源动态8

首个MCP架构、只50行代码就能实现高效RAG的开源框架UltraRAG 2.0

检索增强生成系统(RAG)复杂度提升,使科研人员面临高昂工程实现成本。清华大学、东北大学、OpenBMB等联合推出UltraRAG 2.0,基于MCP架构,降低技术门槛与学习成本,让科研专注创新。

PaperAgent
推荐文章7

AI 创业,需要重读 Paul Graham 的「创业 13 条」

2009年YC创始人Paul Graham发表《Startups in 13 Sentences》,虽时间久远但核心观点不过时。创业者Chris Saad、Yaniv Bernstein结合经验和当下环境,剖析这13条创业原则,涵盖选联合创始人、快速发布产品等内容。

Founder Park