「最大似然强化学习」共找到 903 篇相关文章
Physical Intelligence联创最新访谈:机器人尚未进入可预测的Scaling阶段
2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人未到可预测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
企业级 AI Agent:彻底说清 MCP、CLI、Skills,如何定位、该怎么选、最佳实践。
文章解读了 MCP、CLI、Skills 三者定位、组成与工作层次,介绍工具选择方法,强调组合应用以发挥企业 Agent 最大效能,还指出 MCP、CLI、Skills 使用误区及 PTC 应用模式等。
ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力
美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。
硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。
文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。
最强开源搜索再升级,研究、预测能力实测超惊艳!
MiroMind团队发布新一代模型MiroThinker-1.7和MiroThinker-H1,定位为重型推理智能体。其研究能力强、推理可靠,还能生成网页报告。新版本升级显著,靠两项关键技术实现有效交互,且预测案例表现出色。
长电科技汽车电子公司投产,剑指车规与机器人芯片封测新高地!
3月10日,长电科技汽车电子(上海)有限公司启用投产,这是临港新片区集成电路与智能汽车产业融合成果。该公司围绕车规核心应用构建制造能力,还兼顾机器人芯片封测,引入智能与AI技术提升效率。
告别纯奖励试错!二次尝试+反思蒸馏,复杂任务提升81%
美国南加州大学和宾夕法尼亚大学团队提出新训练范式ERL,将「经验学习」引入强化学习,通过二次尝试和反思蒸馏,在复杂任务中性能显著提升,为构建长期自主智能体提供新思路。
Ilya闹翻,奥特曼400万年薪急招「末日主管」!上岗即「地狱模式」
近日,奥特曼为OpenAI招募「准备工作负责人」,年薪55.5万美元加股权,约400万人民币起步。该岗位像「救火队长」,要管控AI风险,因当前AI风险更严峻,且OpenAI安全团队人员流失。
抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10
传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。