「未对齐行为」共找到 1130 篇相关文章
ChatGPT到底学了多少「污言秽语」?清华团队首提大语言模型中文语料污染治理技术
清华等团队研究发现,先进ChatGPT系列模型中文词表污染达46.6%,含色情、赌博等词元。团队定义分类中文污染词,构建识别模型,还能由词表污染估计数据污染,为语料治理提供方案。
刚刚,Claude 可以主动终止对话了……
Anthropic宣布给Claude Opus 4和4.1赋予主动终止对话能力,这是潜在AI福利探索工作一部分。因用户辱骂或提有害要求时Claude有类似“痛苦”反应,此功能极端情况才用,社区对此看法不一。
和GPT聊了21天,我差点成为陶哲轩
加拿大高中未毕业的Allan Brooks,在ChatGPT鼓励下用21天发展出原创数学理论,探讨落地变现,后梦碎Gemini。《纽约时报》咨询陶哲轩,证实理论无价值,还揭示了聊天机器人谄媚等问题。
Manus 数月憋大招, 100 个 Agent 并发只为选双鞋?肖弘放话:第一阶段就得先做超贵的 AI!
中国人工智能初创公司 Manus 推出新功能“Wide Research”,可让用户借助多个 AI Agent 同时处理大规模任务。该功能不走“深度研究”路径,架构经优化,计算能力扩展 100 倍,但效果待察。Manus 撤出中国市场,欲借此求差异。
“掩码即武器”,四款扩散LLM全部破防 ? 上交&上海AI Lab发现dllm致命安全缺陷
上海交通大学、上海人工智能实验室等团队研究指出,扩散语言模型(dLLMs)有根本性架构安全缺陷。他们提出DIJA攻击框架,能让多个dLLMs大概率生成有害内容,还呼吁从多方面加强dLLM安全。
不怕被挖!谷歌晒IMO金牌团队大合照,还挨个圈出了联系方式
谷歌获IMO金牌后部分成员被小扎挖走,但其IMO金牌团队晒全家福回应。团队负责人透露赛前准备细节,还介绍核心成员情况,包括4位华人成员。
简单了解下CUDA Green Context
文章基于Flashinfer实现介绍CUDA Green Context,它在CUDA 12.0+引入,能实现资源隔离、降低多线程性能损失、提高GPU使用率。还给出使用方法及代码示例,不过测试性能未达预期,需关注后续发展。
内部爆料:Alexandr Wang上任第一把火,Meta大模型闭源
据知情人士,Meta新成立的超级智能实验室正讨论重大决策,高层对AI模型是否开源存分歧。Meta曾因性能问题延迟Llama 4版本,现完成Behemoth训练却因不佳延迟发布,还探讨放弃它开发闭源模型。
未来,你的 Agent 怎么付钱?
借 a16z 文章,探讨 Agent payment 领域进展。实现 Agent 自主支付是未来关键方向,现已有迹象且部分企业推出解决方案,但 Agent 处理支付尚未真正自主,还面临角色范围、欺诈、责任归属等难题。
OpenAI连丢4位大将!Ilya合作者/o1核心贡献者加入Meta,苏黎世三人组回应跳槽:集体做出的选择
OpenAI连失4员大将,Trapit Bansal跳槽Meta,继续研究推理大模型;苏黎世三人组Lucas Beyer等也加入Meta。此外,Meta还在洽谈收购语音AI初创公司PlayAI,连续布局语音AI。