强化学习系统」共找到 2987 篇相关文章

推荐文章8

硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。

文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。

AI大模型应用实践
开源动态8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔
开源动态7

蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理

医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。

CourseAI
新闻资讯8

Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光

2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。

InfoQ
开源动态8

别养龙虾了,硅谷Agent新潮流是「爱马仕」

免费开源的Hermes Agent上线一个月霸榜GitHub Trending,标星超6.66万。它强调持续学习和自我进化,能自动提炼可复用技能。安装门槛低,支持多系统,还原生支持个人微信。

量子位
新闻资讯7

Meta为他豪掷2亿美元,上交校友庞若鸣,晒出在苹果的最新论文

苹果基础模型团队负责人庞若鸣即将加入Meta,Meta为其开出2亿美金天价。7月9日庞若鸣宣传在苹果参与的研究《AXLearn: Modular Large Model Training on Heterogeneous Infrastructure》,介绍了AXLearn系统优势、架构、实验评估等。

机器之心
开源动态8

DeepSeek在Agent上做了件大事!

昨天DeepSeek发布V3.2正式版,强化Agent能力并融入思考推理,其在Agent评测达开源模型最高水平。文中分析Agent成开源‘心病’的痛点,介绍DeepSeek相关解决策略及成果,还给出使用示例。

PaperAgent
新闻资讯7

微软31年老员工被裁,六旬老将重新踏上求职路

新智元报道,微软31年老员工Mike Kostersitz被裁。近年AI重组其所在部门,致他命运改写。过去两年硅谷盛行裁员,AI浪潮下,有经验的技术人员首当其冲,像他这样的中层正被系统优化。

新智元
新闻资讯7

麻省理工 NANDA 研究发现,只有 5% 的组织把 AI 工具大规模用于生产

麻省理工 NANDA 报告指出,95%企业组织的 AI 投入无回报,仅 5%将 AI 工具规模化用于生产。原因是 AI 系统存数据、适应变化及持续学习能力不足,领导层对 AI 项目信心下降。

AI寒武纪