核心任务」共找到 3469 篇相关文章

算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。

深度学习自然语言处理
产品应用7

The Batch: 916 | Gemini 强势领跑

谷歌更新旗舰 Gemini 模型,推出 Gemini 3.1 Pro Preview,以相同价格实现性能跃升。它在多项基准测试中领先,性价比超对手,虽部分测试落后竞品,但提升或源于模型质量改进,成本效益策略值得关注。

DeeplearningAI
开源动态8

多模态Deep Research,终于有了「可核验」的评测标准

俄亥俄州立大学与 Amazon Science 等联合发布 MMDR - Bench,将多模态 Deep Research 评估拉到可核验标准。它含 140 个专家任务,覆盖 19 领域,把评估拆成 3 段管线、12 指标,强调过程证据链。

机器之心
推荐文章8

Anthropic 2026 Agentic Coding 趋势报告:软件开发的 8 大变革

Anthropic《2026 Agentic Coding Trends Report》基于企业实战数据,总结了AI编程Agent重塑软件开发的8大趋势,分基础、能力、影响三类,附企业案例,还给出2026年四大优先事项。

AGI Hunt
算法论文8

华为发布业界首个扩散语言模型Agent,部分场景提速8倍!

华为等团队研究发现,把Agent“底座”换成扩散式大模型(DLLM),执行速度提升30%以上,部分复杂任务效率达传统AR模型8倍。其优势源于生成范式,可重塑Agent设计。

量子位
产品应用8

首个大规模记忆湖发布,AI Infra跑步进入“记忆”时代

LLM是AI的“第一大脑”,记忆平台是“第二大脑”。当前AI企业应用进入生产力时代,竞争聚焦“隐性知识”记忆化。质变科技发布MemoryLake,具备多方面能力,在性能上优势显著,已服务众多用户和企业。

量子位
推荐文章8

AI 原生研发范式:从“代码中心”到“文档驱动”的演进

文章讲述AI编程时代,用SDD解决上下文腐烂、审查瘫痪、维护断层问题,并提供人机协作SOP。介绍SDD理念、实操流程、团队协作方式,还提及资产沉淀、风险防范和常见问题解答,助力研发高效转型。

阿里云开发者
产品应用8

完全取代Claude Code?OpenAI反击来了,推出Codex app「限时免费使用」

OpenAI推出macOS版Codex应用,反击Claude Code。它有全新交互界面,助开发者管理多AI Agents,支持并行任务。限时内,ChatGPT部分用户可免费使用,速率限制有调整,还具备多种新特性。

AI寒武纪
开源动态7

中途退学的艺术生,开发Web 3D项目,周下载量破400万

近日,Three.js 官方公布其周下载量突破 400 万。它是基于 WebGL 的 JavaScript 3D 图形库,承担诸多 Web 页面核心 3D 渲染工作。AI 降低其准入门槛,其创始人成长经历独特,开源风格克制。

机器之心
产品应用7

13 万人收藏的 Openclaw 登顶GitHub No.1!附上超绝性价比部署指南!(保姆级)

Openclaw在GitHub上Star数近13万,登上多榜单TOP1。作者介绍用GitHub Codespaces零成本搭建其服务,搭配Kimi K2.5模型和Discord应用,还给出部署步骤、常见问题解决办法及功能演示。

开源星探