「人在循环中」共找到 8897 篇相关文章
西湖大学打造了一个AI科学家,突破人类SOTA,还能自己发论文
西湖大学文本智能实验室推出能自主探索的AI科学家DeepScientist,两周完成人类三年科研量。它在三个前沿AI任务刷新SOTA纪录,还能写论文。文中介绍其科研历史、工作方式、成果及面临的伦理问题。
北航团队提出新的离线分层扩散框架:基于结构信息原理,实现稳定离线策略学习|NeurIPS 2025
北航彭浩团队提出SIHD框架,基于结构信息原理,自适应构建多尺度扩散层级,实现稳定离线策略学习。通过构建状态拓扑图、用结构信息增益引导扩散、引入结构熵正则化器,在D4RL测试中表现出色。
AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了
FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。
用“因果规划”解决多智能体协作中的任务依赖难题|港科广&腾讯
港科广和腾讯研究团队提出CausalMACE方法,将因果推理机制引入开放世界多智能体系统。该方法含全局因果任务图,框架分“判断”“规划”“执行”环节,在基准任务中表现出色,已中稿EMNLP 2025 Findings。
第一名方案公开,代码智能体安全竞赛,普渡大学拿下90%攻击成功率
亚马逊举办代码智能体安全比赛,普渡大学团队 PurCL 作红队以超 90% 攻击成功率夺冠。他们耗时八月、花百万美元开发全过程红队系统并开源,还发现当前 AI 安全研究在复杂领域对齐有挑战。
剑指“美国版 DeepSeek!”Ai2 科学家 Nathan Lambert 最新访谈:剖析 RLVR、激辩智能体与后训练
艾伦人工智能研究所科学家 Nathan Lambert 在访谈中剖析 RLVR、激辩智能体与后训练。他所在团队用 Olmo 和 Tulu 模型揭开后训练魔法,带火 RLVR 概念。他还谈到开源 AI 未来,想打造“美国版 DeepSeek”。
奖励模型终于迎来预训练新时代!上海AI Lab、复旦POLAR,开启Scaling新范式
在大语言模型后训练阶段,奖励模型设计与训练是关键瓶颈。上海AI Lab、复旦推出预训练奖励模型POLAR,采用策略判别学习新范式,适配强化微调,性能和泛化能力强,为LLM后训练带来新可能。
龙虾之后,我看到了 OPC 的新机会:FDE
3月龙虾爆火催生上门安装生意,大厂纷纷下场。背后是FDE商业模式,即前沿部署工程师模式。该模式在AI时代火起来,因AI Agent需求难定义,且做FDE门槛降低。FDE能弥合产品与需求差距,对OPC创业有借鉴意义。
安谋科技发布“周易”X3,一场“中庸”的突围 | 甲子光年
11月13日安谋科技发布“周易”X3 NPU IP,专为端侧AI打造。当前端侧AI市场不确定大,芯片设计难平衡专用与通用。“周易”X3采用DSP+DSA融合架构,转向混合浮点,提升带宽,搭配开放软件平台,在多方面找到平衡。
开源DeepSeek R1增强版:推理效率快200%,创新AoE架构
德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三大模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本大减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。