「SDE评测体系」共找到 1165 篇相关文章
写Verilog、调CUDA,总翻车?工业代码大模型开始学会「先想后写」了
工业代码大模型缺的往往是‘想’的能力。北航联合多家单位提出的InCoder - 32B Thinking,让模型结合工业环境思考,通过ECoT从错误中学习,用ICWM提前预判结果,还能自适应思考深度,且模型与代码已开源。
独家 | 前理想汽车联创沈亚楠成立「赫宇机器人」,布局家庭机器人
AI科技评论独家消息,前理想汽车联合创始人沈亚楠创立「北京赫宇机器人科技有限公司」,进军家庭机器人方向。赫宇机器人是其智能住宅品牌「栖息地」体系内新业务,项目处早期团队组建阶段。
关于具身智能「触觉」,你想知道的都在这篇综述里了
本文由香港科技大学(广州)熊辉教授团队牵头,联合多所高校,全面梳理截至2026年第一季度具身智能触觉前沿研究。介绍触觉重要性、多模态触觉融合流程、全景蓝图,指出面临挑战并展望未来。
壁垒在上下文,不在模型
特赞科技发布企业级智能体系统 GEA,推出发散推理模型和企业上下文系统。指出模型能力易复制,企业上下文才是壁垒。GEA 架构分四层,有独特的推理和执行模式,已在多家企业部署。
当模型成为公共基础设施,特赞如何架构企业级 Agentic AI?
当大模型成公共基础设施,企业需构建围绕业务结构的智能系统架构。特赞提出的 GEA 企业级智能体架构体系,围绕企业业务运行结构设计,能让智能体参与企业经营判断。
文言文秒杀所有大模型!100%攻击成功,轻松突破安全防线
南洋理工等机构团队提出基于文言文语境的自动化黑盒测试框架CC - BOS,利用果蝇算法和8维策略空间,暴露主流大语言模型安全盲区,实验显示对6款主流模型攻击成功率达100%。
“龙虾”时代,大模型公司的好日子来了
3月10日,MiniMax港股收涨,市值超百度。OpenClaw爆火,其创始人转发评测榜单,使MiniMax-M2.1排名突出。OpenClaw是智能体构建框架,为大模型公司带来盈利转机,撬开收入天花板,引发各方关注。
用Diffusion构建「AI虚拟细胞」,14项指标霸榜!Mila唐建团队破解单细胞「破坏性」测序难题
Mila唐建团队发表PerturbDiff,跳出前人认知盲区,将“细胞群体的概率分布”视为随机变量。它引入数学工具建模,让MMD内生于体系,在多项基准测试霸榜,还提供应对数据稀缺的思路。
nnU-Net:医学图像分割的自适应自动化框架
德国癌症研究中心团队提出 nnU-Net 自配置医学图像分割框架,能根据数据集特征自动推导预处理、网络拓扑等策略获稳健分割基线。文章介绍其原理、优缺点、评测案例及 Python 代码实现。
谨慎用OpenClaw:上海科技大学发布其全面安全体检报告
上海科技大学联合上海人工智能实验室对爆火的智能体OpenClaw做安全审计,在34个测试场景中,整体安全通过率58.9%,暴露出多方面问题,研究据此给出纵深防御策略。