「未对齐行为」共找到 1131 篇相关文章
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。
今天我替煤炭给AI正个名。。。
一份标价8200元的煤炭研究报告称煤炭是可再生资源,可打怪获取,此事引发热议。很多人认为是AI写的,但报告是2022年出版,那时ChatGPT都未发布,实际是人类所为。AI暴露了行业内假装专业的垃圾内容。
才知道百度和阿里为什么能联手瓜分市场了
AI热度未减但问题转变,企业更关注全栈能力。沙利文报告显示2025年上半年阿里云和百度智能云占一站式AI云市场超一半。阿里和百度长期投入,全栈能力让其在竞争中更笃定,苹果也选它们为中国AI伙伴。
大的来了:谷歌Gemini 3.0 Pro单次生成网页版操作系统,Win、Mac、Linux一网打尽
海外平台爆火的视频展示了用未发布的谷歌Gemini 3.0,仅靠几行提示词在2分钟内One Shot生成网页版操作系统。与Claude 4.5 Sonnet对比,Gemini 3.0优势明显,还展现出高超前端设计能力,但离真正构建操作系统仍有距离。
OpenAI「辣椒芯」干翻英伟达!老黄股价不跌反涨
OpenAI自研芯片「小辣椒」跑分碾压英伟达最强blackwell,低延迟、高吞吐、低并发等全达SOTA级别。但英伟达股价未跌反涨,OpenAI也表态不会弃用英伟达。「小辣椒」预计2027年量产,OpenAI还将开发后续版本,不过其数据中心负责人离职,无人接手。
Issue修复开源No.1!蚂蚁 | 提出代码图模型:CGM,结合GraphRAG架构,领先最强开源7.33%
为解决开源模型在仓库级代码理解上的能力瓶颈,蚂蚁全模态代码算法团队提出 CGM 架构,融合仓库结构与语义信息。CGM 首创图结构与语言模型融合的对齐框架,还搭配了 GraphRAG 框架,在多个代码任务中表现出色,且相关资源均已开源。
1700亿美元估值!Anthropic融资50亿,AI独角兽争霸战进入新阶段
Anthropic拟融资30 - 50亿美元,估值达1700亿美元,或成全球估值最高未上市AI公司之一。它由前OpenAI成员创立,聚焦AI安全。核心产品Claude有独特优势,与GPT - 5各有千秋。其商业化侧重企业,虽增长快但亏损大,业内对估值看法不一。
阿里千问大模型换将,32岁林俊旸官宣告别
阿里巴巴高级算法专家、通义千问大模型负责人林俊旸宣布告别千问团队,此前一晚千问团队刚推出Qwen3.5轻量化模型且获马斯克点赞。此外,Qwen3.5核心贡献者Kaixin Li和通义实验室科学家Binyuan Hui也发文告别,几人去向未明。
苹果不吹 AI,反而成功了?
北京时间9月10日苹果发布会,与iPhone 16发布时大肆宣传AI不同,此次重点在硬件及AI幕后支持。此前苹果对AI宣传过度致部分功能未推出引失望,且在智能体AI助手进展落后。多数人不因AI换机,给了苹果试错时间,但它在AI竞赛中落后,中国厂商布局更快。
大基金或将领投DeepSeek?算力拐点将至
5月6日报道国家大基金正洽谈领投DeepSeek首轮融资,估值约450亿美元。大基金此前未公开投资大模型公司,此次若落地是从“半导体硬件”向“AI应用端”延伸。2025年是中国AI芯片出货量关键年份,DeepSeek-V4发布,多家国产芯片品牌完成适配,但国产芯片仍面临性能、软件生态等挑战。