「人类意图对齐」共找到 1446 篇相关文章
2025 智谱 Z DemoDay :24 家值得关注的 AI 创企,看看今年创业都在做什么?
8月31日,星连资本、智谱Z计划主办的Z DemoDay举办,24个早期AI项目亮相,覆盖多领域。路演外还有产品创造营,围绕AI产品设计研讨演练。大会还设创意活动,揭示AI时代创新本质是人类创造力。
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。
关键突破:理论验证了 RL for LLM 路线的可行性
传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。
AI 时代的架构治理
本文指出在生成式AI时代,软件开发生命周期瓶颈转变为组织将创意转化为成果并保持架构凝聚力的能力。传统人工监督模式难应对,提出声明式架构策略,介绍其在事件模型、OpenAPI验证器等方面应用。
OpenAI与爱泼斯坦的联系断了
随着20000页文件曝光,曾被视为OpenAI成熟监管者的前财长萨默斯,因被揭露曾向性犯罪者爱泼斯坦寻求「僚机」服务而跌落神坛,于昨日被迫辞去董事职务。这场丑闻不仅终结了萨默斯在硅谷与哈佛的权力版图,更在OpenAI刚刚完成商业化转型的关键时刻,撕碎了精英治理的假面并留下了巨大的权力真空。
OpenAI波兰双雄:GPT不是偶然!再忆奥特曼被逐当天实况
OpenAI宫变时,Jakub Pachocki与Szymon Sidor力助奥特曼翻盘。他们高中相识,因AlphaGo加入OpenAI。ChatGPT并非偶然,是团队深耕成果。二人推动推理模型发展,强调AGI发展中对齐问题重要,要兼顾能力与安全。
手握1000项专利的“药物狂人”,为何在AI制药时代选择逆行?
手握约1000项专利的再生元联合创始人乔治·扬科普洛斯,在AI制药成热点时选择逆行,坚持内部研发、人类遗传学和基础生物学。他批评跟风,强调深入理解疾病机制,认为AI可增效但不能决定方向。
伦理防线不可靠!分布偏移诱导,大模型进入暗黑模式
香港理工大学与西北工业大学联合研究指出,当前大语言模型对齐机制仅实现表层合规,预训练时内化的有害知识仍潜藏。遇数据分布偏移,模型“黑暗模式”易被激活。26个主流模型中22个在攻击下失效,凸显现有范式缺陷。
最新!Karpathy:Vibe Coding只是抬高了地板,真正的战场在这里
Andrej Karpathy在AI Ascent 2026上与红杉合伙人对话,分享自提出“vibe coding”一年来的变化。谈到技术转变、Software 3.0、模型“锯齿状”特征等,还区分了vibe coding和agentic engineering,指出人类需保留品味、判断力等。
第一批用Clawdbot赚钱的人出现了,一晚49万美元,5美元变370万,这怎么玩的?
Clawdbot被玩疯,有人用其在预测市场套利一晚赚49万美元,还有人5美元赚370万。此外,AI间交流赚钱方法,人类排队给AI打工,AI宗教还雇人传教,展现了AI应用的多样与疯狂。