「反思探索」共找到 804 篇相关文章
用动作分块突破RL极限,伯克利引入模仿学习,超越离线/在线SOTA
如今强化学习在多领域成果显著,但在长跨度、稀疏奖励任务中表现欠佳。加州大学伯克利分校研究者提出Q - chunking方法,将动作分块引入基于时序差分的强化学习,解决探索效率和值传播问题,实验表现优异。
吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板
Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。
真机RL杀疯了!机器人自学20分钟100分,数字孪生封神
至简动力等提出数字孪生协同强化学习框架 TwinRL,可在真机高效执行在线强化学习。它用手机构建数字孪生,让机器人先探索再真机操作,20 分钟达 100%成功率,比现有方法快 30%,还降低人类干预。
京东「再造」京东
京东推出「京东AI购」App,页面极简,仅留对话框,能像助理般提前感知需求。它兼顾快思考与慢思考场景,同一架构兼容两种决策方式,对话框设计降低决策成本,产品有分寸感,是探索未来电商的先锋。
逆天!Mata用13个参数26字节让模型正确率从76%飙升至91%
Meta等机构研究人员发布TinyLoRA极致微调技术,配合强化学习,能在几乎不改变大模型原有结构下,用极少数参数激发其推理能力。该技术在数学推理上表现出色,还探索了参数共享策略和存储精度问题。
马斯克星舰试验再创历史!3次爆炸3次推迟终成功,顺利完成太空载荷部署
美国中部时间26日晚,马斯克星舰第十次发射试验圆满成功。此次采用B16+S37组合,历经助推器返回、载荷释放、太空再点火等环节,虽过程波折,多次推迟和爆炸,但终达成目标,向太空探索迈进。
Anthropic:我们如何构建多智能体研究系统
Anthropic分享构建多智能体研究系统的经验,该系统用多个Claude智能体探索复杂主题。介绍了多智能体系统优势、架构、提示工程、评估方法,也提及生产环境的挑战,此系统处理开放式研究任务价值大。
她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽
本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。
推荐系统进入“大模型时刻”:昇腾NPU如何支撑千亿级生成式推荐落地
文章基于华为郭威在2025 AICon大会演讲,复盘华为推荐技术探索。介绍FuXi-α、β模型设计,解决训练和推理难题;分享“多阶段统一建模”进展,提出Performance Law;还介绍了训推系统优化及未来聚焦“强算力”“强模型”融合。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。