内生奖励」共找到 699 篇相关文章

推荐文章8

英伟达不是被计划出来的

英伟达成全球首个市值破5万亿美元企业,打破企业体量天花板想象。其GPU起初为游戏而,CUDA曾是失败项目,却因深度学习需求成AI关键。其崛起证明伟大难被计划,创新源于多元互动。

芯师爷
算法论文7

POF | 西北工业大学马榕池、高传强等:基于预解分析的圆柱绕流最优射流控制位置对雷诺数依赖性研究

本文提出预解分析有效增益指导控制位置量化设计方法,发现不同雷诺数下最优控制位置关系式,挖掘出射流与主流掺混作用的流动机理,即射流在科恩达效应有效行程到分离点可最佳抑制涡脱。

力学与人工智能
产品应用7

AI 创作继续:Google 推出Pomelli,一款能读懂你网站气质的 AI 营销设计师

Google Labs推出AI营销工具Pomelli,可帮中小企业几分钟创建符合品牌的社交媒体活动。流程为给其网站,它建立品牌“商业DNA”,成活动创意和资产,用户编辑调整即可。输出仅支持英文,出海网站可尝试。

AI进修生
新闻资讯7

AI助手Cici悄然霸榜海外,又是字节

AI智能助手领域有新玩家,字节跳动的Cici在多个国家应用商店霸榜,数月下载量爆发式增长。它融合字节旗下技术,文本成用到OpenAI、谷歌模型。同时,豆包在国AI智能助手赛道全维度领先。

量子位
新闻资讯7

Claude估值暴涨300%!全球独角兽字节第三他第四

Anthropic官宣完成F轮130亿美元融资,最新估值达1830亿美元,较上轮暴涨近300%,成全球第四大估值初创公司。半年营收从10亿美元年化突破50亿,Claude Code年收入破5亿。

量子位
算法论文8

让AI作画自己纠错!随机丢模块就能提升成质量,告别塑料感废片

来自清华、阿里等的团队推出S² - Guidance方法,通过随机丢弃网络模块动态构建子网络实现自我修正。它避免了其他方法繁琐调参,在文图和文视频任务中显著提升成质量与连贯性,且计算高效。

量子位
算法论文8

混合数学编程逻辑数据,一次性提升AI多领域强化学习能力 | 上海AI Lab

上海AI Lab的OpenDataLab团队通过大规模实验剖析RLVR在多领域推理机制。构建多领域评估框架与定制奖励策略,基于Qwen2.5 - 7B系列模型联合训练,有多项关键发现,为构建AI推理模型提供参考。

量子位
新闻资讯8

DeepMind 发布超真实世界模型 Genie 3,AGI 向前一步

谷歌旗下DeepMind发布通用型世界模型Genie 3,可通过文本提示成动态世界并实时交互,其容物理一致性达分钟级。它功能丰富,也受业好评,但有行动空间有限等局限,对迈向AGI意义重大。

AI科技评论
新闻资讯8

硬核「吵」了30分钟:这场大模型圆桌,把AI行业的分歧说透了

在WAIC 2025大模型论坛的“模型之问”圆桌中,多位行业大佬围绕大模型展开辩论,话题涉及训练范式、模型架构、数据、开闭源等核心问题,不同观点碰撞,深入探讨大模型技术演进与发展之路。

机器之心
算法论文8

多模态模型学会“按需搜索”,少搜30%还更准!字节&NTU新研究优化多模态模型搜索策略

字节与NTU优化多模态模型搜索策略,通过搭建工具、构建数据集及设奖励机制,用强化学习训练模型,使其按需搜索。实验显示,MMSearch - R1系统少搜30%还更准,为多模态大模型发展提供洞见。

量子位