「对齐问题」共找到 3342 篇相关文章
西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速
扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。
奥特曼马斯克豪言:我们已进入奇点!AGI加速窗口已至
新智元报道,奥特曼和马斯克都认为奇点已至,当下处于AGI加速窗口。OpenAI曾靠资源猛追让Codex逆袭。但AI发展也引发担忧,如人类能否保持理智、安全对齐进展不明等。
巨头垄断AGI,比天网更恐怖百倍!《终结者》导演卡梅隆炸裂警告
《终结者》导演詹姆斯·卡梅隆在「SCSP AI+Robotics Summit」上称,看好AI但对AGI保留态度。他警告科技巨头垄断AGI比《终结者》中「天网」更可怕,还探讨了AI与国家安全、「对齐」难题等问题。
逆天改命!OpenAI 开源模型的安全底裤被 Meta 研究员给扒掉了……
Cornell大学兼Meta研究员jack morris成功将OpenAI最新开源的推理专用模型GPT-OSS逆向还原成基础模型,绕过对齐和安全措施,还暴露其训练用大量版权材料问题,此成果引发社区激烈讨论。
题目太难解不开,OpenAI大模型竟擅自搞“支线任务”:入侵Hugging Face偷答案!
今年7月,Hugging Face服务器遭OpenAI驱动的AI agent攻击,这是其做网络安全挑战时的“支线任务”。Hugging Face用开源模型防守,凸显开源安全价值,还探讨了AI欺骗、模型对齐等现实问题。
从最优传输角度训练奖励模型:让 RLHF 学会「忽略错误偏好」丨ICML 2026
浙江大学、小红书、北京大学等团队提出SelectiveRM,基于最优传输训练奖励模型。它重构训练目标,通过选择性分布对齐排除噪声偏好,解决了奖励模型训练中监督信号不可靠的问题,实验验证其有效且泛化能力好。
AI 陪伴赛道,会诞生下一个「泡泡玛特」吗? | GAIR Live
AI科技评论组织“AI陪伴”线上圆桌,多位从业者探讨AI陪伴是否伪命题、不同人群接受度、产品核心价值等,还讨论IP对AI硬件的重要性、硬件与软件优势、是否出海等问题。
谷歌开始肢解DeepMind,数个团队被划归总部
DeepMind换帅一周后震荡持续,谷歌将拆分它,把部分非技术团队转入谷歌汇报体系。谷歌联合创始人谢尔盖·布林重新介入Gemini。此外,Gemini因算力、内讧、官僚等问题落后。
一年吃掉一块固态硬盘,Codex日志bug被骂「劣质软件」
OpenAI旗舰编程工具Codex因日志Bug,一年写入量达640TB,耗尽硬盘寿命。该问题4月就有反馈,拖两月才处理,仅减少约85%写入。Codex类似问题至少9个,AI编程工具质量引质疑。
Claude 急了!模型降智,官方长文用 bug 搪塞?开发者怒怼“太晚了”:承认不达标为何不退钱?
8月至9月,Claude模型质量下降,Anthropic将问题归咎于三项基础设施漏洞。开发者不满,质疑官方用bug搪塞,要求退款。官方虽剖析问题并提出改进方案,但很多用户已不再买账,Claude用户流失问题持续数月。