「自我奖励训练」共找到 2494 篇相关文章
Bug变奖励:AI的小失误,揭开创造力真相!
最新研究发现,AI的「创造力」并非额外能力,而是架构副作用。扩散模型本应是复制机器,却画出奇怪图像。研究者基于规则构建数学系统,证明了这一观点,还推测人类灵感或许同理。
半年复盘,AI迎来预训练后的新瓶颈。
2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。
AI 驱动的数据库心脏:如何让云原生「自我进化」
本文深度解析腾讯云自研云原生数据库 TDSQL - C,它融合 Serverless、AI 技术,解决传统数据库痛点。具备存算分离、智能伸缩、AI 预测等特性,能降本增效,还可全球部署,为企业数字化出海提供数据基座。
阿里、南开大学发布免训练,视频大模型创新压缩方法
视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。
自我进化Agent综述:通往超级智能的进化之路
当前大型语言模型面对新知识、动态环境时存在固定参数瓶颈,自进化智能体研究应运而生。本论文作为该领域首部系统性综述,提出革命性框架,解析自进化智能体技术脉络与未来挑战。
为了「自我锤炼」,OpenAI 造了一个攻击力极强的「AI 黑客」
OpenAI宣布扩展网络安全计划Daybreak,推出GPT‑5.6‑Cyber,分蓝队和红队。红队模型模拟黑客找漏洞,能力强悍,高危安全任务完成率达95%。但此举也带来安全风险,OpenAI采取分级授权等措施。
AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”
AI画图速度慢,过往主流加速方法有局限。MrFlow团队提出三阶段流水线,在Qwen - Image等模型上实现10倍以上端到端加速,生成效果好,优势显著,还能与时间步蒸馏叠加,且完整开源。
构建知识闭环:用CodeBuddy打造自我进化的数据分析体系
腾讯团队为解决数据分析痛点,构建知识闭环体系,利用CodeBuddy设计开发规范、自动生成SQL,将编码从小时级降至分钟级。体系含沉淀、传递、生成、信赖、闭环五环,提升团队效率与协作。
微调已死!「共识机制」实现提示词自我进化,性能飙升
人工智能领域正从「模型微调」向「上下文工程」转变。西湖大学MAPLE实验室齐国君教授团队提出基于「共识机制」的提示词组进化算法C - Evolve,能突破单一提示词性能局限,提升系统整体性能。
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。