「Agentic RL」共找到 2887 篇相关文章
强化学习也遇到了“天花板”?Andrej Karpathy构建了一个新算法
大神Karpathy肯定强化学习(RL)价值,指出其比监督微调更具扩展性,但存在渐进式学习低效、背离人类学习机制的局限。他提出“第二天性”新范式算法,还面临泛化等挑战。
李志飞:1 个人、2 天做出 AI 时代的「飞书」,真正的 Founder Mode
出门问问创始人李志飞在「TicNote」发布会上分享「一人公司」实验。他用AI编程工具2天做出AI时代“飞书”原型,还谈了使用AI编程问题、对智能和Agent思考等,重新找回AGI信仰。
让AI主动干活,给你找服务,鸿蒙“6”啊
在HDC 2025上,鸿蒙展示服务分发展示新能力,能让服务主动找用户。它形成Agent行动网络,推出“探索”服务流。奈雪、东方财富等已加入,华为为开发者提供多种工具及激励政策。
从案例分析到提示词写作,手把手教你制作最火爆的AI视频
文章教大家制作火爆的AI视频,介绍爆款分析、创意拓展、提示词生成等方法。用NotebookLM分析视频,Gemini拓展创意,还给出提示词模板。借助Veo3降低成本,最后完成视频生成、合并及后处理。
抢先OpenAI?AIUI全新升级燃爆22亿终端,国内大厂定义智能交互
科大讯飞围绕智能交互场景,对AIUI、机器人超脑等4大平台全面升级。其AIUI以大模型为引擎,有儿童专属交互方案,还推出智能眼镜“三麦阵列”等,各平台在多领域应用成果显著。
强化学习之父:LLM主导只是暂时,扩展计算才是正解
新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习,强化学习潜力需靠扩展计算支撑。
AI编码新神登基,藏师傅一手Claude 4实测
Claude 4低调发布,Anthropic称Claude Opus 4是全球最佳编码模型。发布内容含扩展思维、新模型能力等,还公布定价。Claude Opus 4编码和记忆能力强,实测表现出色,Claude Sonnet 4也有提升且免费。
云知声发布U2-Flash,要争“大模型主力位”|甲子光年
本文报道云知声发布U2-Flash大模型,基于原有U2基座,通过创新后训练方案提升Coding、Agent等复杂任务能力,多项评测比肩头部模型,目标成为企业真实生产任务的主力大模型。
拆解 Claude 5.1:38 小时不睡觉的背后,Anthropic 正在终结「模型论」
Anthropic 更新 Claude 5.1,推出 Fable 5.1 和 Mythos 5.1,将‘智力’与‘权限’物理剥离。前者负责通用任务,后者面向专业场景。此次更新展示模型解决长时任务状态一致性等问题的能力,还体现了能力权限分离等变化。
DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分
DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张图成本不到20美分,还上线免费Files API。