能力成熟度框架」共找到 4489 篇相关文章

开源动态8

比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA

兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。

量子位
新闻资讯8

DeepMind发布SIMA 2!打通「感知-推理-行动-反思」闭环

DeepMind推出的SIMA 2,可让智能体在虚拟环境中边聊天边进行复杂多模态推理。它整合Gemini能力,从指令执行者变为互动伙伴,有强大迁移泛化与自我提升能力,是迈向AGI重要一步,但也面临一些挑战。

新智元
新闻资讯7

最新实测GPT-5-Codex:前端能力碾压,复杂项目轻松搞定,Claude可以扔了!

OpenAI发布GPT-5-Codex,网友称可告别Claude Code。实测其前端能力提升大,能轻松完成复杂项目,如一键生成小游戏、手稿直出网页等。虽有页面UI堆叠小瑕疵,但仍值得支持。此外,Grok 4有突破,马斯克看好Grok 5。

新智元
开源动态8

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。

机器之心
新闻资讯7

写在 Claude Design 发布之后:如果明天巨头做掉了你的核心功能,你该怎么办?

Anthropic 发布 Claude Design,可从提示词生成设计稿等,让 Figma 市值蒸发。这引发对 AI 应用层产品的思考,当基础模型厂商收回能力,靠能力缺口的产品将失重,应用层需从工作流、数据等找机会。

AI科技大本营
推荐文章7

默认选择 React,等于是在扼杀前端创新

文章指出默认选 React 正减缓前端创新。如今团队选前端常出于习惯而非技术契合度,使 Svelte、Solid、Qwik 等创新框架难被采用。默认选 React 还带来运行成本、架构惰性等问题,呼吁根据需求选框架

InfoQ
算法论文8

浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力

浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。

新智元
开源动态8

字节突然开源Seed-OSS,512K上下文碾压主流4倍长度!推理能力刷新纪录

字节跳动突发开源360亿参数的Seed-OSS-36B,呼应OpenAI开源策略。它有512K超长上下文,引入“思考预算”机制。多项基准测试达开源SOTA,字节Seed团队此前也开源多个项目。

量子位
新闻资讯7

消费者别急,苹果给AI手机『画的饼』,大概是这样

6月10日苹果全球开发者大会举办,iOS 26发布引关注。苹果AI能力滞后,其筹划的AI手机有端侧AI分布、AI辅助能力先行、更酷炫大统一UI等特点,此次系统升级对其未来布局关键,苹果盈利和销量已下滑。

鲸选AI
算法论文8

从「说错话」到「干错事」:复旦、CityUHK、SMU、UIUC等13家机构联合发布「具身智能安全」综述

具身智能正从实验室走向现实世界,却带来‘干错事’的现实风险。13家机构38位学者联合发布70+页综述,提出‘能力—风险’二象性,梳理各能力层攻击面与风险,还指出研究空白,维护开放资源生态。

机器之心