「能力维度」共找到 3329 篇相关文章
模型不是企业的护城河,那什么才是?
文章指出企业AI进入深水区后,真正的竞争是将AI变成企业自己的智能引擎。衔远科技创始人周伯文提出泛化基础上的深度专业化是企业竞争力来源。衔远发布EnterpriseClawBench,揭示企业需私有化评估和可持续进化能力。
OpenClaw代码越改越崩?新研究EvoClaw揭示:Agents持续开发成功率仅13.37%
USC邓港大等联合发布评估基准EvoClaw,揭示AI在持续开发场景下表现不佳,成功率仅13.37%。研究还指出当前评测易高估AI能力,提出DeepCommit重构演进历史,分析各模型在持续演进中的局限与问题。
GPT-6 Astra 正式登场:烧了 10 万块 GPU、多项跑分逼近满分,OpenAI 总裁:我们迎来 AGI 时代
今天凌晨,OpenAI正式发布GPT - 6 Astra。它多项跑分逼近满分,OpenAI总裁称其或意味着AGI时代开始。该模型在多方面能力领先,安全措施升级,将在‘未来几天’面向部分用户推出。
GPU为什么能取代CPU,成为计算领域无可争议的核心?
过去CPU是计算核心,如今GPU崛起取代之。二者架构不同,GPU并行处理强。人工智能、大数据等领域需其能力,软件支持助其普及,未来或融合创新,成计算领域主角。
炸裂!谷歌I/O大会王者归来:Gemini“世界模型” 初现,搜索“换脑”,一句话制作原声电影
谷歌I/O 2025大会发布大量技术,虽Gemini 2.5 Ultra未到,但Pro有革新。还推出新模型、代理工具,多模态能力提升,搜索重塑,加入AI眼镜开发,倾尽全力发展AI生态。
达尔文.skill正式发布,一个无限进化的skill系统!
作者受Karpathy的autoresearch启发,开发了达尔文.skill系统,可自动评估和优化skill。它有五条原则、八维度评分体系,能批量解决skill质量问题,与Anthropic官方工具互补,现已开源。
FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性
FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,多模态成难题。
吴恩达:不理解计算机的工作原理,你不可能单靠 Vibe Coding 就走向卓越,基础知识依然至关重要
吴恩达指出懂AI的开发者供不应求,但计算机专业应届生失业率上升,因大学课程未跟上时代。他面试看重借助AI助手开发、运用AI基础模块构建应用等能力,强调基础知识仍重要。
科研智能体「漫游指南」—助你构建领域专属科研智能体
该综述提供科研智能体构建指南,提出三级分级系统,阐述构建流程与能力增强方法,涵盖知识组织、注入、工具集成,还提及基准评估和未来研究方向,促进AI与自然科学融合。
2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道
2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。