「行为校准强化学习」共找到 927 篇相关文章
Scaling Law再现Agent领域!阿里提出训练新范式:在预训练和后训练之间还需一个Agentic CPT
近年来,大型语言模型向智能体系统进化。但当前主流方法构建智能体不佳,阿里通义实验室团队论文提出智能体持续预训练(Agentic CPT)新范式,开发AgentFounder模型,在多基准测试表现卓越。
蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理
医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。
用“蒸汽机”生成视频,还能音视频一体化交付?
8月21日百度营销发布百度蒸汽机2.0,含多版本,有声版可音视频一体化交付。经测试,其生成视频细节佳、运动规律合理。它能解决影视业诸多痛点,成本低,还可免费使用。
MiniMax秀了波AI视频杂技:越看越惊艳,指令遵循太强了
MiniMax发布海螺2.0版本,能处理极端物理情况,原生支持1080P,在指令遵循、生成质量达一流水平,成本效率破纪录。此前还开源MiniMax - M1,两大底层技术创新让其成果惊艳,展现研发实力。
文档解析OCR全新升级,追平Gemini2.5pro,超越MinerU、碾压Qwen2.5VL-72B
CourseAI介绍PP - StructureV3实战、能力、性能与架构。它在通用版面解析等方面能力强,更新PP - OCRv5提升准确率,超主流OCR方案,轻且速度快,但遇特殊情况需重新训练。
奥特曼:温和奇点已降临!AI最终掌控物理世界,2030年人类命运大转折
奥特曼在「温和的奇点」一文中称人类跨越AI发展「事件视界」,进入指数级加速阶段。他预测了未来5年技术时间线,还指出奇点悄然渗透,AI自转飞轮越来越快,人类迈向超级智能时代机遇与挑战并存。
与Gemini Diffusion共振!首个扩散式「发散思维链」来了
西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型。
Physical Intelligence联创最新访谈:机器人尚未进入可预测的Scaling阶段
2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人未到可预测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。
金融AI武道大会开赛!四道业务真题,出题人:猜不到最优解
AFAC2026金融智能创新大赛开赛,赛题源于真实金融场景,如识别交易行为、还原金融文档等。它强调回归基础研究,探索模型产业价值,是今年金融AI领域值得关注的比赛。
给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策
上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。