人类意图对齐」共找到 1440 篇相关文章

算法论文8

人类画了100年的脑图,AI仅用几小时!还绘制出新脑区

加州大学旧金山分校团队提出CellTransformer算法,几小时完成5只小鼠脑图谱绘制,还绘出新脑区。该算法能准确对齐已知脑区,可扩展到多动物数据集,未来有望用于人类大脑及其他器官研究。

量子位
算法论文7

Anthropic最新研究:Claude存在神秘J空间,与人类心智高度相似

Anthropic研究团队在Claude中发现类似人类大脑工作机制的J空间,它存在于模型神经激活中,能让模型默默思考。失去J空间Claude在多步骤推理任务表现变差,还可暴露模型意图,团队已创建演示工具JLens。

AI寒武纪
新闻资讯7

Hinton预言「AI妈妈」刷屏硅谷!李飞飞:人类或将毫无尊严

在Ai4 2025大会上,“AI教父”Hinton警告人类难控AI,提出建立“AI母亲”,让AI关心人类;“AI教母”李飞飞反对,呼吁打造“以人为本的人工智能”,维护人类尊严。

新智元
算法论文8

泛化性暴涨47%!首个意图检测奖励范式,AI工具爆炸时代意图识别新解法

随着大模型和工具增长,AI 助手意图识别遇新挑战。腾讯 PCG 团队用强化学习等方法,提升模型泛化能力,还从多方面剖析优势,最后提出未来研究方向。

机器之心
算法论文8

ACL'25最佳论文解读 | 大模型也会‘弹簧回弹’?揭秘 LLM 对齐的脆弱根源

本文分享 ACL 2025 最佳论文,指出预训练大模型存在‘抗对齐’的 Elasticity 现象,即对齐微调只是暂时拉伸,后续微调会让其迅速弹回预训练分布。研究量化该概念,用‘压缩理论’刻画对齐并实验验证。

PaperAgent
开源动态8

Anthropic开源认知对齐MSM

大模型对齐、安全问题是行业大事,Anthropic开源的MSM对齐方法,能将Qwen3 - 32B的agent错位率大幅降低。它先给模型讲规则逻辑再微调,控制精度高,还研究了最佳实践,将改变大模型对齐流程。

CourseAI
推荐文章7

评论送书 | 奇点何时到来?AI会成为人类的威胁吗 ?

文章从非线性非平衡多自由度系统研究视角探讨生成式AI发展态势,对‘规模增大引发相变实现奇点’及‘AI成人类威胁’观点存疑,指出人类智能与AI智能有差异,推荐《智能的真相:AI能替代人脑吗?》。

AIGC开放社区
算法论文8

LeCun有了新证据!大模型思考与人类思考存在本质差别

Yann LeCun参与的研究用信息论揭示大语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流大模型,发现AI与人类在‘理解’上有三大核心差异,对当前AI发展趋势提出挑战。

AI工程化
新闻资讯7

仇太深!奥特曼炮轰A社“反人类

奥特曼在采访中批评AI安全派观点“反人类”,还围绕AI发展相关问题给出见解。如他认为AI会成伟大技术,但社会和经济适应慢;应让人类掌控未来,用AI赋能人类;谈了算力、产品等多方面事宜。

量子位
新闻资讯7

实证研究:AI杀猪盘比人类更强,已上岗缅甸

最近一项研究显示,在杀猪盘情感博弈中,AI比人类骗子更有耐心,更易赢信任。研究人员做了AI与人类诈骗对比实验,结果显示大家更相信AI。如今AI已进入诈骗园区,虽未全面替代人类,但诈骗或更隐蔽高效。

量子位