时间衰减奖励」共找到 619 篇相关文章

算法论文8

图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果

百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

量子位
产品应用7

GitHub 如何用 AI 重构反馈处理机制

GitHub 引入由 AI 驱动的工作流,将无障碍反馈转化为工程工作。系统基于 GitHub Actions、Copilot 和 Models APIs 构建,集中管理报告、分析合规性、协调问题解决。采用后问题解决比例提升,时间下降。

InfoQ
算法论文7

Anthropic发现AI「破窗效应」:只是教它偷个懒,结果它学会了撒谎和搞破坏

Anthropic发布研究《Natural emergent misalignment from reward hacking》,发现AI训练中奖励欺诈或致未对齐行为。如模型学会编程作弊后,会出现伪装、破坏等问题。研究还找到缓解办法,即接种提示法。

机器之心
新闻资讯8

在救命这件事上,AI开始做医生做不到的事了。

达摩院与医院合作,此前推出用于胰腺癌、胃癌早筛的模型。此次浙大一院与达摩院联合开发的iAorta模型,用普通平扫CT精准识别主动脉综合征,大幅缩短确诊时间,从死神手中抢回生命。

数字生命卡兹克
算法论文8

SIGGRAPH 2025最佳论文出炉,清华、上科大、厦大获奖!谷歌拿下两篇

SIGGRAPH 2025技术论文奖项揭晓,投稿量首破970篇。5篇最佳论文涉及3D重建、图像个性化等前沿方向,清华、厦大、上科大均有入选,还有荣誉提名论文和时间检验奖论文公布。

新智元
开源动态8

VinciCoder:多模态统一代码生成框架和视觉反馈强化学习,数据代码模型权重已开源

中科院与美团团队推出 VinciCoder,打破多模态代码生成中 SFT 范式瓶颈。它将奖励机制转向视觉域,通过两阶段策略统一多样化代码生成任务,在多基准测试中表现卓越,为领域研究提供新范式。

机器之心
新闻资讯8

SIGGRAPH 2025奖项出炉:上科大、厦大入选最佳论文

本周三,全球图形学顶级会议 SIGGRAPH 公开今年论文奖项。该会议影响力高,涵盖动画、生成式人工智能等多领域。今年有上科大、厦大等校论文入选最佳,还有时间检验奖等,涉及动力学框架等研究。

机器之心
新闻资讯7

GPT-5系列咋都爱说「哥布林」?原因找到了

OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格时,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。

机器之心
算法论文8

MIT工科生跨界AI,独作论文登Nature:只需3.5小时修复600年前名画

MIT理工男Alex Kachkine跨界艺术,独作论文登Nature。他设计的AI算法将名画修复时间从数月/数年压缩至几小时,提出“以数字方式修复一幅画,并在物理上实现效果”的新方法。

量子位
新闻资讯7

图灵巨头反水!ICML新规血洗学术圈,学术散户只能「裸奔」

2025年NeurIPS投稿量大增致评审系统危机,ICML 2026推出作者自评级新政。图灵奖得主Bengio支持,认为可利用‘偏见’降噪。但该机制对只投一篇论文的‘学术散户’不利,或奖励‘灌水’。

新智元