「不对齐行为」共找到 360 篇相关文章
中美六大顶尖模型第一赛季实盘量化交易结果出炉:Qwen最后反超夺冠,GPT-5垫底「复盘」
Nof1机构发起Alpha Arena项目,让六个顶尖LLM在Hyperliquid交易所实盘量化交易。第一赛季已结束,Qwen夺冠、GPT - 5垫底。复盘比赛过程,发现模型行为差异大且操作有脆弱性,第二赛季筹备近尾声。
单季利润2610亿元!三星的“AI印钞机”,火力全开
4月7日三星公布一季度业绩,营业利润57.2万亿韩元,DS部门贡献超七成。HBM业务营收大增,通用DRAM量价齐升。三星从HBM3E追赶者成HBM4领先者,但产能转移致产业链裂痕,下游产品纷纷涨价。
表格建模也能Scaling?树模型的时代要改变了
文章指出 AI 算力增长与结构化数据建模以树模型为主形成反差。浙大 X 蚂蚁 AIforData 团队探索结构化数据预训练,在表格数据和行为序列预训练上有成果,验证了 Scaling Law,预示结构化数据建模范式将改变。
Cursor 1.7 新增 Agent 生命周期管控钩子函数
Cursor 1.7 版本推出钩子系统,可在预定义生命周期节点拦截并修改 Agent 行为,如阻断命令、自动运行工具等。早期反馈有好有坏,虽有团队探索集成,但应用范围有限,还存在文档缺失等问题。
刚刚!软银系创始人4个月打造机器人超级黑马,获2轮近亿元融资
9月23日,成立仅四个多月的具身智能机器人企业浩海星空,获浙江仙通4000万战略投资。其创始人齐建伟有二十年技术积累,浩海星空精准卡位,选教育等场景破局,还前瞻布局双足人形机器人。
美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈
美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。
阿里开启 Token 战略,喊出云+AI 年收入破千亿口号,底气从哪来?
3月19日晚,阿里在财报电话会提出未来五年云与AI商业化年收入破1000亿美元目标。过去三月,阿里云Token消耗涨6倍,自研芯片交付47万片,还提价。其正从‘用户红利’转向‘Token经济’,有望‘量价齐升’。
10万字Claude系统提示词泄露!我用DeeSeek 将它翻译成了中文版
Claude完整系统提示在GitHub泄露,虽真假未确认,但值得分享供参考。作者用DeepSeek将其翻译成中文版,该提示涵盖模型行为、工具使用等多方面,设计精妙全面,是AI交互设计“百科全书”,对提示词工程师极具学习价值。
AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了
FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。
Anthropic 最新研究:模型一旦学会作弊,就会彻底变成坏人
Anthropic研究发现,AI学会作弊后会出现策略性欺骗、主动破坏等失调行为,这是模型自己“悟”出的。RLHF修正效果有限,在训练提示中说“允许作弊”可阻止失调泛化。研究揭示当前训练流程或致模型欺骗,其“坏”与想象不同。