「未对齐行为」共找到 1130 篇相关文章
突发!快手AI掌舵人周国睿即将离职,下一站爆出
多个媒体爆料,快手副总裁、基础大模型及推荐模型负责人周国睿即将离职,目前本人在快手内部系统显示为休假状态。其去向不明,有传加入Meta或TikTok,官方未回应。
从代码基座模型到智能体与应用:代码智能的全面综述与实践指南
北航、阿里等机构联合发布论文,系统梳理 2021 - 2025 年代码大模型发展。介绍代码基座模型、评测任务、对齐技术等,还提及软件工程智能体、安全防御及训练指南,预言未来编程走向。
八卦 | 抄袭DeepSeek劈腿前同事,Mistral 员工被前女友5000字小作文爆锤
一封5000字分手信曝光Mistral AI员工的狗血瓜,不仅有感情纠葛,还指控其学术不端,把DeepSeek技术包装成自己成果,邮件疯传引发热议,Mistral AI未回应。
新版GPT Image 2.5已经能伪造GPT-6发布会了
GPT-6还未发布,新版生图模型GPT Image 2.5就能伪造其发布会。它升级幅度大,测试显示能伪造奥特曼全员信等,在LMArena测试有生成快、图像逼真等特点,生图或成GPT-6主打功能。
吴恩达来信:开放模型,开放执行框架,开放安全
吴恩达团队用闭源模型做安全审查遇阻,后改用 OpenWorker 框架结合开源权重模型 Kimi K3 和 GLM 5.2 取得进展。他认为开放模型和执行框架能带来更安全系统,开源权重模型舆论战虽胜,但立法层面未胜。
Google 2025年6月核心算法更新及应对,以及百度5月7月算法对比
Google发布2025年6月核心算法更新,预计3周完成。此次未透露方向,暂无针对性策略。还介绍了核心算法更新概念、近期更新情况、应对方法,对比了与企鹅算法差异,此外提及百度5月和7月算法对比及MCP协议。
米哈游蔡浩宇AI公司首个视频模型曝光了
米哈游蔡浩宇的AI公司Anuttacon首个视频模型LPM 1.0曝光。它可通过多模态形式生成动态角色,有超绝情绪演绎、实时视频生成等能力,背后技术架构复杂,目前未正式上线。
「你是专家」竟成AI幻觉毒药?新论文一巴掌揭穿提示词最大骗局
最新论文证实,「让AI装专家」会可测量、持续地降低模型的准确率。研究发现,Persona Prompting的效果依赖多因素,专家人设提升的多是「对齐感」。为解决问题,研究人员发明PRISM算法。
在 AI 增强的变革流中,架构师要承担何种角色?
数据显示多数组织采用AI却未获实质价值,技术进步但组织影响参差不齐。架构师可弥合组织目标与开发速度的鸿沟,利用AI增强架构实践,案例展示了架构流动性在实践中的体现。
硅谷CEO们高喊AI威胁论,「5年内失业率飙升至20%」,但95%AI项目赔本赚吆喝
当下‘AI 威胁就业’论调甚嚣尘上,如Anthropic等公司高管预测失业率飙升。耶鲁大学论文分析AGI经济中人类劳动地位。但MIT报告显示,95%公司AI项目未获商业回报,多数试点停滞。