核心能力」共找到 4454 篇相关文章

开源动态8

Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布

近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。

机器之心
算法论文8

浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力

浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。

新智元
开源动态8

字节突然开源Seed-OSS,512K上下文碾压主流4倍长度!推理能力刷新纪录

字节跳动突发开源360亿参数的Seed-OSS-36B,呼应OpenAI开源策略。它有512K超长上下文,引入“思考预算”机制。多项基准测试达开源SOTA,字节Seed团队此前也开源多个项目。

量子位
新闻资讯8

“最强编码模型”上线,Claude 核心工程师独家爆料:年底可全天候工作,DeepSeek不算前沿

Anthropic 开发者大会发布 Claude 4 ,含 Opus 4 和 Sonnet 4 型号,在基准测试表现出色。核心工程师预测年底软件工程智能体能力,谈 RL 及 DeepSeek,还提到模型自我意识、推理计算瓶颈等问题。

InfoQ
新闻资讯7

消费者别急,苹果给AI手机『画的饼』,大概是这样

6月10日苹果全球开发者大会举办,iOS 26发布引关注。苹果AI能力滞后,其筹划的AI手机有端侧AI分布、AI辅助能力先行、更酷炫大统一UI等特点,此次系统升级对其未来布局关键,苹果盈利和销量已下滑。

鲸选AI
算法论文8

从「说错话」到「干错事」:复旦、CityUHK、SMU、UIUC等13家机构联合发布「具身智能安全」综述

具身智能正从实验室走向现实世界,却带来‘干错事’的现实风险。13家机构38位学者联合发布70+页综述,提出‘能力—风险’二象性,梳理各能力层攻击面与风险,还指出研究空白,维护开放资源生态。

机器之心
算法论文8

测试时Scaling或是最大错觉,Google:R1/O1强推理另有原因

Google 112 页论文实证,OpenAI 的 o 系列等模型推理能力提升并非仅因计算时间延长,而是源于对复杂互动的隐式模拟。通过三重验证表明推理能力跃迁或因‘吵得更凶’,而非‘算得更久’。

PaperAgent
产品应用8

DeepSeek睁开眼了!Opus-4.8的性能,1000张图不到20美分

DeepSeek首个多模态视觉模型deepseek-v4-flash-vision-exp上线DeepSeek API平台。文本能力与V4-Flash持平,多模态Agent能力逼近Opus-4.8,分析1000张图成本不到20美分,还上线免费Files API。

AIGC开放社区
产品应用8

Eino ADK:一文搞定 AI Agent 核心设计模式,从 0 到 1 搭建智能体系统

大语言模型发展下,Agent成AI落地主流,但传统开发有痛点。Eino ADK为Go开发者提供智能体开发框架,解决核心难题,还介绍了Agent功能、ADK模式、构建方法及多Agent协作场景等。

InfoQ
新闻资讯7

独家揭秘OpenAI核心文件:AGI五级突破实锤!微软130亿投资或打水漂

新智元揭秘OpenAI核心文件,Ilya Sutskever曾预言AI无所不能,也担忧其失控后果。OpenAI与微软的合同中AGI条款成谈判核爆点,未公开论文划分AGI五级,让微软130亿投资或打水漂。

新智元