「奖励信号」共找到 374 篇相关文章
告别「手搓Prompt」,前美团高管创业,要让物理世界直接成为AI提示词
在2025年AI硬件赛道火热背景下,Looki创始人孙洋团队打造Looki L1可穿戴设备,将自动驾驶逻辑用于生活场景,转化视听信号为模型上下文,构建用户专属数据飞轮,让AI实现主动共鸣。
初赛鸣金,精英集结 | 云谷杯·2025 人工智能应用创新创业大赛初赛顺利举行
11月7日,云谷杯·2025人工智能应用创新创业大赛初赛线上举行,100余项目角逐,30个进复赛。大赛多方主办,赛制等全面升级,有丰厚奖励和政策支持,承办方InfoQ助力项目成长,复赛将选10强。
刚刚,Meta风雨飘摇中发了篇重量级论文,作者几乎全是华人
风雨飘摇的Meta发布重量级论文《Agent Learning via Early Experience》,提出「早期经验」新范式,让AI智能体「无师自通」,为突破强化学习瓶颈提供新思路。该范式结合两种策略,实验效果显著,还指出了局限与未来方向。
微软开源2025 ICML获奖框架,终结大模型多轮对话严重缺陷
微软开源2025年ICML获奖框架CoLLabLLM,可解决大模型多轮对话缺陷。它由四大模块构成,经多轮对话模拟和奖励优化模型。在三大基准平台测试显示,能在多样任务中高效协作。
苹果港大终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!
苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。
AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%
大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。
灵初智能陈源培:一个 00 后的机器人之梦
00 后陈源培是灵初智能联创,本科土木工程专业,大二因比赛对机器人感兴趣。他研究灵巧手,参与开源项目,灵初发布相关模型。他认为强化学习对灵巧手重要,还谈了模型、创业、落地等看法。
大厂的AI不限量补贴终会结束!Hermes Agent作者:开源框架真正的狠招是把Claude对Anthropic的忠诚抢过来
科技创作者 Peter Yang 对话 Hermes Agent 作者之一 Karan Malhotra,探讨 Hermes Agent 与其他产品的差异、模型谄媚问题、开源意义等。Karan 指出其独特自我改进系统与专注用户需求特点,还提及让模型更贴合用户的方法。
VeRL-Omni:面向扩散和全模态生成模型的通用RL后训练框架
VeRL-Omni是面向多模态生成模型的通用RL后训练框架,覆盖多种架构。它有高效多模态rollout、灵活奖励引擎等特性,支持多种硬件,团队还验证了不同训练方式,后续将扩展模型与算法支持。
“没有一张卡是空的”,阿里腾讯加码,算力军备进入“抢购下半场”
5月13日,腾讯和阿里巴巴释放AI算力投资加码信号。腾讯业绩增长,资本开支增加,高层称下半年采购提速;阿里CEO吴泳铭表示服务器算力利用率近极限,投资回报确定,支出或超3800亿。产业呈现三重新趋势。