「结果导向强化学习」共找到 1203 篇相关文章
月费3万,成本为零:谁在收割企业的GEO焦虑?| 甲子光年
GEO指针对生成式AI进行结果优化,提高品牌被纳入回答的机会。当下GEO市场乱象丛生,多数服务商报价随意、技术原始,靠“黑帽”做法捞金。不过也有行业规范派在建立标准。其背后是流量入口争夺战,未来提示词或成新货架。
视觉强≠能干活!清北普林斯顿等开源WorldArena,世界模型评测被颠覆
2026 年 2 月 13 日,清华、北大等顶尖机构联合推出的 WorldArena 面向全球开源。这是首个‘功能 + 视觉’统一评测体系,撕开了‘美丽视频’伪装,让评测从‘审美导向’走向‘功能导向’。
17 条举措出台,大步迈进 AI 消费时代!
6月18日,商务部等八部门发布《关于加快“人工智能+消费”发展的实施意见》,文件覆盖广,有三层逻辑,还藏着新信号。不过AI消费落地有挑战,该文件标志AI行业拐点,消费时代序幕已拉开。
AMS | 西工大向锦鹏、宋述芳等:一种用于伴随方程求解的物理约束图神经网络
伴随方法用于高维优化问题,但求解伴随方程代价大。本文提出物理约束图神经网络(ADJ - PCGN),构建流场解与伴随向量映射模型,有精度和泛化性,能加速优化,方便嫁接求解器。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。
在AK大神爆火的任务里,摸清国产AI真实水平
4月20日深夜Kimi K2.6发布并开源,作者借Andrej Karpathy的AI Wiki思路设计高承压任务,测试其Agent底层能力,考察它在单Agent、Agent网站和Agent Swarm三种模式下表现,探究国产AI真实水平。
重磅开源!首个全异步强化学习训练系统来了,SOTA推理大模型RL训练提速2.77倍
清华大学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。
CMAME | 香港理工大学周原野、周恺等:面向清晰几何边界工程优化的拉格朗日拓扑物理信息神经网络
近年来物理信息神经网络引入拓扑优化领域,但结果边界弥散。本文提出“拉格朗日拓扑物理信息神经网络”框架,将显式可变形基础几何体嵌入可微分物理求解器,提升了优化结果的可制造性与精度。
真机RL杀疯了!机器人自学20分钟100分,数字孪生封神
至简动力等提出数字孪生协同强化学习框架 TwinRL,可在真机高效执行在线强化学习。它用手机构建数字孪生,让机器人先探索再真机操作,20 分钟达 100%成功率,比现有方法快 30%,还降低人类干预。
vLLM 新特性:批量大小不再影响模型输出
vLLM 推出批量不变推理功能,解决大模型推理中相同输入在不同批量大小下结果不同的问题。设置 `VLLM_BATCH_INVARIANT=1` 可保证输出一致,技术实现含三部分,虽有性能开销但换来了结果确定性。