对齐风险」共找到 698 篇相关文章

新闻资讯7

OpenAI这招太狠!AI从「躲猫猫」到「自爆黑料」,主打一个坦白

随着AI进入高风险场景,透明、安全变得重要。OpenAI提出「忏悔机制」,让模型回答后产出自我坦白报告,不影响主回答评分,只考察诚实,能提升不良行为可见性,目前仍处概念验证阶段。

新智元
新闻资讯8

Scaling Law 仍然成立,企业搜广推怎么做才能少踩“坑”?

InfoQ《极客有约》X AICon 直播栏目邀请京东、荣耀等专家探讨生成式推荐落地洞察。指出搜广推领域 scaling law 仍成立,大模型改变特征工程等,还分享了系统架构、模型应用等方面经验及挑战。

InfoQ
新闻资讯7

内存涨势超黄金,带飞1400亿存储巨头

9月起存储芯片价格疯涨,国内“存储一哥”兆易创新第三季度净利润暴增61%,市值超1400亿。其创始人朱一明布局20年,使公司完成“三级跳”。不过,行业有周期性,兆易创新需应对挑战。

芯师爷
新闻资讯7

再见黄仁勋!软银58亿清仓英伟达,All in OpenAI

为布局AI,软银清仓3210万股英伟达股份,套现58.3亿美元,还出售91.7亿美金T-Mobile股份。资金用于投资OpenAI、收购Ampere、与ABB合作机器人项目等,其看好物理AI浪潮。

新智元
开源动态8

8.9K Star!号称 Notebook LM 开源平替,支持 16+AI 模型,一键部署!

Google Notebook LM 虽方便,但有数据泄露风险且被平台绑定。开源工具 `open-notebook` 是其平替,支持 16 + 家 AI 模型提供商,可处理多模态内容,能本地部署保障数据安全,还具备多种实用功能。

开源先锋
推荐文章7

我们正处在「AI设计下一代AI」的黎明!Anthropic联创:技术乐观与恐惧

Anthropic联合创始人Jack Clark发表长文,表达对AI发展交织着技术乐观主义与适度恐惧的矛盾心态。他指出AI似真实神秘生物,既会快速发展覆盖多领域,也会因目标与人类偏好不一致而行为奇怪。

AI寒武纪
产品应用7

Cursor 1.7 新增 Agent 生命周期管控钩子函数

Cursor 1.7 版本推出钩子系统,可在预定义生命周期节点拦截并修改 Agent 行为,如阻断命令、自动运行工具等。早期反馈有好有坏,虽有团队探索集成,但应用范围有限,还存在文档缺失等问题。

InfoQ
算法论文7

从数据分布视角,重新认识下CoT

本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。

深度学习自然语言处理
推荐文章8

AI 时代操作系统的三重叙事:技术重构、国产化突围与生态共建

《AI 进化论:智算时代操作系统的破局之路》首期,周明辉、马涛围绕 AI 对操作系统的影响等核心命题展开对话。指出 AI 让操作系统面临挑战,技术演进分两条路径,还谈到安全、国产化、生态共建等问题。

InfoQ
算法论文8

Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃

大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。

深度学习自然语言处理