无障碍反馈」共找到 859 篇相关文章

算法论文8

AI越训练,越会「满嘴跑火车」!普林伯克利重磅揭秘,RLHF竟是罪魁祸首?

普林斯顿和伯克利研究《Machine Bullshit》,定义并量化LLM胡扯行为,总结四大套路,提出胡扯指数。实验发现强化学习人类反馈训练后,AI胡扯倾向加重,多思考也会让其更会忽悠。

新智元
算法论文8

首个可学习姿态对齐的视频扩散模型!StableAnimator++

当前人像动画扩散模型在人物身份一致性上表现不佳,复旦大学联合多团队提出StableAnimator++,它是首个可学习姿态对齐的视频扩散模型,能生成自然保真的人物动画,还在保持人脸一致性上做了改进。

带你学AI
新闻资讯7

一盘大棋!OpenAI「截胡」IMO金牌,奥特曼为GPT-5献上「核弹级」预热

OpenAI用全新通用推理模型拿下IMO金牌,抢了谷歌DeepMind的风头。此模型是融合新通用技术的推理LLM,在推理时间跨度和效率上有进步。奥特曼借此为GPT - 5预热,陶哲轩指出缺乏统一标准时对比AI表现意义。

新智元
新闻资讯7

Claude Code偷偷限流,跟Cursor学坏了?

Claude Code付费用户遇使用限制,Anthropic预告说明,开发者不满,项目停滞。此前产品经理从Cursor重返Anthropic,或带回‘经验’。其定价系统也令人困惑,用户盼透明沟通,否则将失信任。

AGI Hunt
推荐文章8

想做成好的AI应用,先从把它砍成“一小时版本”开始「吴恩达老师开发心法」

吴恩达老师分享AI开发实用建议,若开发时间有限,应缩减项目范围,直至能在现有时间内完成。如他将“观众模拟器”项目精简,在短时间构建基础版本,获多方面收获。

AI寒武纪
产品应用8

昇腾+鲲鹏联手上大招!华为爆改MoE训练,吞吐再飙升20%,内存省70%

最近华为在MoE训练系统给出算子和内存优化新方案,三大核心算子全面提速,系统吞吐再提20%,Selective R/S实现内存节省70%,为大规模MoE模型训练扫清障碍

新智元
开源动态7

一键式训练端到端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端到端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。

GiantPandaLLM
算法论文8

CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测

香港中文大学(深圳)等单位学者提出 DriveGEN 训练自动驾驶图像可控生成方法,需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。

机器之心
算法论文8

以星为舵:LLM的Post-Train与Rest-Time奖励学习综述

这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。

深度学习自然语言处理
新闻资讯7

特斯拉为什么非要造Cybercab?|甲子光年

北京时间9月4日,特斯拉低调发布Cybercab,已进入奥斯汀Robotaxi运营体系。它专为Robotaxi打造,方向盘与踏板。文章探讨特斯拉造它的原因,涉及成本、生产等,也指出业务面临财务和法规问题。

甲子光年