「AI世界」共找到 10168 篇相关文章
Agent大革命!Claude 4连续自动编程7小时,刷新世界记录
今天凌晨Anthropic召开开发者大会,发布Claude 4,含Opus 4和Sonnet 4。Opus 4编程智能体连续工作7小时破纪录,Sonnet 4在SWE - bench表现超前沿模型。还新增功能,Claude Code开放,API也有新特性,Sonnet 4免费但有限制。
何恺明等降维打击!彻底颠覆AI生图,无需预训练一步到位
何恺明团队推出生成模型MeanFlow,它跳脱传统训练范式,无需预训练等,仅一次函数评估就能完成生成。在ImageNet 256×256上表现优越,缩小了一步与多步模型性能差距。
「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!
大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。
OpenAI发力AI应用!前Meta产品总裁将任应用部门CEO
Sam Altman宣布生鲜电商平台Instacart首席执行官Fidgi Simo加入OpenAI,担任新设立的应用部门CEO。该部门将整合业务和运营团队,推动研究成果惠及全球用户,实现规模化扩张。
刚刚,翁荔博客又上新:通过Harness工程实现AI自我提升
翁荔新博客聚焦Harness Engineering,梳理围绕‘Harness自我优化’的研究,探讨递归式自我提升发生层面,还指出自动化研究和自我提升系统面临的瓶颈,如评估标准模糊、奖励作弊等。
邢波再出手:上次「骂」完世界模型,这次轮到智能体了
邢波教授新作《智能体模型批评》上线 arXiv,质疑当下被称为「智能体」的系统是否名副其实。论文将其分为两类,沿五维度拆解主流设计,提出 GIC 架构,还探讨了安全问题,指出要让能力内化进模型。
Anthropic发布Claude Science,AI开始像研二学生一样做科研
当地时间6月30日,Anthropic发布科研产品Claude Science。它运行Claude Opus 4.8,亮点在使用方式,将科研所需整合,还能拆分任务。早期用户反馈良好,与OpenAI、谷歌竞争,已开放测试版。
GPT-5.5反杀Claude登顶,AI编码旧榜不准了?
Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程榜单。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。
大模型也需要睡觉!让AI打个盹,醒来更聪明
卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。
估值315亿!田渊栋AI创业,谷歌、英伟达和AMD参投
Meta离职的田渊栋官宣创业,成立RSI,获6.5亿美元融资,估值约316亿。8位联创阵容豪华,团队致力于构建开放式架构,让智能体自主学习升级,目标打造具5万博士能力的智能系统。