贝叶斯自适应强化学习」共找到 760 篇相关文章

新闻资讯8

灵初智能陈源培:一个 00 后的机器人之梦

00 后陈源培是灵初智能联创,本科土木工程专业,大二因比赛对机器人感兴趣。他研究灵巧手,参与开源项目,灵初发布相关模型。他认为强化学习对灵巧手重要,还谈了模型、创业、落地等看法。

AI科技评论
开源动态8

阿里开源创新AI Agent:媲美Deep Research,Github每日增长第一

人类信息检索能力受限,OpenAI的Deep Research虽能解决难题但闭源。阿里巴巴通义实验室开源AI Agent框架WebSailor,在多基准测试表现出色,核心技术围绕复杂任务生成和强化学习模块展开,在Github成绩亮眼。

AIGC开放社区
开源动态8

单Agent时代正式结束:一个干不过,就上300个

月之暗面发布并开源 Kimi K2.6 模型,热度高。它强化 Agent 团队协作能力,核心能力进步,领先对手。在编程领域发力,长程编码能力突破,集群协同输出强,还适配框架,实测效果出色,Claw 群组开启内测。

机器之心
新闻资讯7

OpenAI发布GPT-5!这是一篇很主观的解读...

OpenAI发布GPT - 5,一口气推出三个版本API。发布会图表出错被吐槽,其自适应思考能力似抄Claude作业。发布会重押编程能力,因Anthropic靠Claude在API市场抢了不少写代码用户,实测中GPT - 5与Claude 4.1表现接近。

花叔
新闻资讯8

OpenAI总裁透露GPT-5改了推理范式,AGI实现要靠现实反馈

OpenAI总裁Greg Brockman在访谈中透露AGI之路,包括技术上转向强化学习推理范式,资源上持续投入计算资源,落地时封装成Agent。还提到GPT - 5改变推理范式,强调计算对AGI的重要性及模型落地等内容。

量子位
算法论文8

逆天!Mata用13个参数26字节让模型正确率从76%飙升至91%

Meta等机构研究人员发布TinyLoRA极致微调技术,配合强化学习,能在几乎不改变大模型原有结构下,用极少数参数激发其推理能力。该技术在数学推理上表现出色,还探索了参数共享策略和存储精度问题。

AIGC开放社区
新闻资讯8

梁文锋执笔的R1论文登上Nature封面!首次回应外界三大质疑

9月17日,DeepSeek创始人梁文锋通讯作者名义发表的DeepSeek - R1论文登《自然》封面。该模型借助强化学习自主形成推理能力,在Hugging Face下载量破1090万次。新版论文回应质疑,披露训练细节,虽有不足但引发学界关注。

InfoQ
新闻资讯8

从刮胡子机器人到双臂神技!这家具身独角兽引爆亿级美元融资热潮

具身智能大热,Generalist AI展示「拂晓」仿人自适应机器人完成高难度任务。日前,非夕科技宣布完成C轮亿级美元融资。该公司由前DeepMind科学家创立,获英伟达投资,其机器人在多领域有应用。

新智元
算法论文8

大模型能力,小模型成本!Google等 | 提出递归混合框架:MoR, 大幅提升LLM计算效率

Google提出递归混合框架(MoR),融合参数共享与自适应计算。它有轻量级路由和KV缓存策略,在不同路由机制各有优劣。实验显示,MoR在性能、计算和内存效率上表现出色,有望实现“大模型能力,小模型成本”。

AINLPer
算法论文8

大模型化身苏格拉底:通过主动提问挖掘人机协作的深度

微软与南加州大学联合团队研究揭示激发大模型主动提问能力新范式。通过定义主动信息收集任务、提出强化微调策略,经实验验证该方法有效,使模型在多领域表现出色,重新定义大模型角色。

AIGC开放社区