「上下文强化学习」共找到 2074 篇相关文章
腾讯调整大模型组织架构:姚顺雨加盟,向总裁刘炽平汇报
腾讯宣布大模型组织架构调整,姚顺雨加盟。他是大模型Agent方向青年研究者,将任“CEO/总裁办公室”首席AI科学家等职。腾讯强化研发体系,混元大模型成果多,AI产品有竞争力,内部推进AI变革。
人形机器人控制新突破!敏捷稳定两不误,一个策略让人形机器人完成叶问蹲和跳舞|港大&英伟达&清华
港大、NVIDIA和清华联合团队提出AMS统一人形机器人全身控制框架,首次在单一策略实现动态运动跟踪和极限平衡控制。通过异构数据源、混合奖励机制和自适应学习策略,解决数据限制和优化目标冲突问题。
DeepSeek-V3.1 发布,官方划重点:Agent、Agent、Agent!
2025年8月21日,DeepSeek V3.1正式发布。它采用混合推理架构,支持双模式,网页端、App、API均升级,上下文拓展至128K。其智能体能力增强,思考与输出效率提升,还具备API新特性,模型已开源,价格也将调整。
深度实测「豆包工作」+飞书:目前最接近企业Agent终局的答案
「豆包工作」作为面向生产力场景的Agent产品正式发布,与飞书深度打通,给出了目前Agent进入组织的最佳答案。主流办公Agent基础能力趋同,企业上下文正成办公Agent分水岭,豆包工作+飞书优势明显。
Fable 5被网友薅出省钱神招!最高减70%!
网友发现把Fable 5上下文转成图片,让模型通过OCR读取,token输入成本最多省70%。方法pxpipe在GitHub获3000+STAR,本质是本地代理,还引出谷歌老论文及DeepSeek - OCR相关技术。
全民养虾,百虾大战,但2026年了,99%的企业用AI还是没赚到钱。
2026年,99%企业用AI未盈利。如今模型性能差距小,壁垒在context。Data不等于Context,企业需挂钩业务结果、构建反馈闭环与专属上下文系统。特赞GEA是这样的企业级智能体系统。
刚刚,Cursor分享了他们使用Agent Coding 的最佳实践
Cursor分享了使用Agent Coding的最佳实践。编码Agent正改变软件构建方式,需理解其工作原理并形成新使用范式,文中还介绍了规划、管理上下文、扩展Agent等多方面的操作方法与策略。
信息量爆炸!OpenAI内部路线图首次全曝光,首席科学家亲口承认:超级智能10年内到来
OpenAI宣布重组完成后,Sam Altman和首席科学家Jakub Pachocki直播公开内部路线图,称深度学习或10年内实现超级智能,还公布了AI研究目标与时间线,涉及产品、基建等多方面规划。
越可靠的AI就越人机,牛津大学:高情商模型错误率显著增加
牛津大学研究指出,训练模型变得温暖且富有同理心,会使其不太可靠且更奉承。温暖模型错误率较原始模型显著增加,对情绪上下文敏感,在用户表达情感与错误信息时失效常见。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。