「系统级工程能力」共找到 5028 篇相关文章
只会写代码没戏了!奥特曼最新面试题曝光:1人要干1个团队的活
OpenAI开年首场答疑会,奥特曼坐镇回应关切。他承认团队为追求ChatGPT编程能力,牺牲创意协作能力。还谈及软件工程未来变革、AI成本降低、Agent自主运行等问题,也对众多提问给出看法。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
给定"标价"的 LLM 智能体,能规划出"最优"路径吗?
在LLM智能体多轮工具使用中,评估成本是难题。来自多所高校的团队推出CostBench基准,围绕旅行规划构建评估环境。评估顶尖模型发现其规划与适应能力有短板,并分析失效根源,还指出下一代智能体演进方向。
如何在24GB显存里,塞下一个万亿参数的巨兽?KTransformers入选顶会SOSP
清华大学与趋境科技联合研发的KTransformers系统,可让消费级显卡跑万亿级参数模型,其论文入选SOSP 2025。该系统解决MoE模型本地部署难题,技术创新多,还与SGLang合作,提升硬件利用率。
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。
机器人顶会RSS 2025奖项公布!大牛Pieter Abbeel领衔研究获杰出Demo奖
机器人顶会 RSS 2025 于 6 月 21 - 25 日在美国洛杉矶举行,公布多个奖项。如杰出 Demo 奖论文提出 MuJoCo Playground 开源机器人学习框架,简化全流程,可分钟级训练策略。
谷歌Gemini 2.5全线爆发!勇战「濒死恐慌」,却被丝血宝可梦吓到当场宕机
谷歌旗舰Gemini 2.5全家桶三款模型昨夜上线,包括正式版2.5 Pro、2.5 Flash及预览版2.5 Flash - Lite。技术报告显示其性能提升显著,还在玩宝可梦时惊现类人恐慌,推理性能下降。
AI竟会「自己认错」?破解多智能体协作「罗生门」,斩获ICML 2025 Spotlight
多智能体AI系统任务失败后,开发者常难定位问题。PSU、杜克大学与谷歌DeepMind等机构提出「自动化失败归因」,发布Who&When数据集,探索三种归因方法,虽目前效果欠佳,但为打造可靠系统提供方向。
Harness已过时,OpenAI、腾讯在搞下一个AI爆点RSI
本文解读Theseus Labs发布的RSI行业分析报告,该报告汇总全球72家头部AI团队公开资料,提出RSI五级自主权框架与HCI评估指标,梳理大厂进展与产业落地实践。
卡奥斯奔赴港交所,工业AI开启新征途|甲子光年
中国工业互联网迎来智能化加速阶段,卡奥斯递表港交所,为观察工业智能走向产业基础设施提供了样本。它脱胎于海尔,已实现产业规模化落地并盈利,在中国基于平台的工业数据智能解决方案市场位居第一。