可核验奖励」共找到 4191 篇相关文章

算法论文7

LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?

论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。

深度学习自然语言处理
算法论文8

PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的学习加权混合自编码器

本文将线性POD与非线性Autoencoder通过学习参数融合,提出学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或降低大规模计算成本。

力学与人工智能
产品应用7

Agentic 应用时代,Dify 全链路观测最佳实践

文章讲述 Dify 平台在 Agentic 应用开发的观测性挑战,从开发者与运维方视角分析现状、局限与改进方向。云监控推出全景观测方案,还介绍各组件监控接入步骤及实践指南,最后提及 Qwen - Image 生图优势。

阿里云开发者
产品应用7

本地运行的高质量的文本转语音模型

介绍Kyutai的Pocket TTS,一款轻量级文本转语音应用,在CPU高效运行,模型小且低延迟,支持Python API和CLI,能语音克隆,还在浏览器试用,目前仅支持英语,也有社区浏览器端实现。

GitHubStore
产品应用7

魔笔 AI Chat Builder:让 AI 对话秒变交互界面

文章介绍阿里云魔笔AI Chat Builder,它能将AI对话变交互界面。对比现有AI应用开发方式,阐述其综合优势,还介绍核心能力、搭建方法、多端发布等,未来将打磨能力并推新功能。

阿里云开发者
算法论文7

AI游戏生成迎来「机制觉醒」:自我进化的玩法设计师

文章指出当前大模型生成游戏存在玩法创新不足、评分虚高等问题。CreativeGame技术关注此问题,通过先写设计文档、激发创意、设计记忆架构等方式,让AI围绕机制持续迭代,探索解释、追踪、迭代的创作范式。

AI科技评论
算法论文8

0.005%参数量超越SOTA!提升模型能力无需庞大奖励模型

上海交通大学等校联合团队提出轻量级奖励模型SWIFT,利用大模型隐藏状态线性特征,仅训练极小线性层,在推理任务中超越主流奖励模型,实现计算效率与准确率双提升,且在多领域表现出色。

AIGC开放社区
开源动态8

这个开源 SKill,把 AI 短剧制作变成了一条复制的工业流水线!

AI短剧圈子现开源项目shuohao - skills,是给AI编码助手用的“插件”。它将小说到投产素材流程拆成五个模块,有清晰设计理念,每步有代码级质量检查,核心亮点多,能实现稳定生产。

开源星探
开源动态7

Screen Studio的开源免费替代品,自媒体必备的录屏神器,MIT协议商用。

文章推荐开源屏幕录制工具OpenScreen,它是Screen Studio平替,虽未覆盖全部功能,但基础功能完善,支持双系统,有诸多实用功能,且遵循MIT协议商用。

开源AI项目落地
开源动态8

字节跳动&清华大学开源多模态时序大模型ChatTS,实现时序数据对话与推理

字节跳动与清华合作开源多模态时序大模型ChatTS,实现时序数据对话与推理。它用合成数据训练,解决了数据稀缺等问题,在评估中表现远超基线模型,未来拓展至更高阶任务。

机器之心