Coding 基准测试」共找到 2875 篇相关文章

产品应用7

AI 写代码这么强,为什么还是干不掉飞书多维表格?

有人认为 Vibe Coding 太强威胁飞书多维表格地位,使其独立开放。但作者认为这高估了 Vibe Coding 能力,低估了飞书多维表格复杂度与应用场景。现在 AI Coding 水平离生产级产品差距大。

宝玉AI
开源动态7

让你的 ClaudeCode 秒变 Openclaw(龙虾),连接飞书、Discord 远程控制

作者用Vibe Coding开发Agent客户端Codepilot,将Claude Code桌面端功能拓展,支持飞书等IM远程连接等。还开源Claude-to-IM及Claude-to-IM-skill项目,前者适合开发者接入IM远程控制,后者可让Claude Code与IM远程交互。

歸藏的AI工具箱
产品应用7

基于OpenAPI和AI coding的上云智能体构建实践

文章介绍基于OpenAPI和AI coding构建上云智能体的实践。分析不同编程范式,结合AI coding发展与Multi - Agent问题,阐述构建方案,包括业务场景、构建方法、技术实现、当前效果及后续展望,还提及文档智能与RAG构建LLM知识库。

阿里云开发者
新闻资讯7

并购激励金都不要了?全程踩中AI Coding,Windsurf核心工程师离开DeepMind

AI Coding 赛道核心工程师 Ronak Malde 离开 Google DeepMind,还放下后续经济激励。他曾参与 Codeium、Windsurf 相关项目,在 DeepMind 推进 Agentic Coding 研究。离职之际他总结心得,下一站备受关注。

机器之心
开源动态8

7.3K Star!用 Orca 组建 AI 舰队:让 Claude Code 和 Codex 同时开工!

Claude Code 大火后,多家大厂推出自家 Code CLI,多终端操作上下文切换成本高。Orca 是开源 AI 编排器,可让多个 AI 编程助手并行工作,集中查看结果,有并行工作区、统一管理界面等亮点。

开源星探
算法论文8

跨越技术与法律的壁垒:AI赋能知识产权领域任务全能评测基准IPBench发布

本推文介绍arXiv论文《IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property》。论文提出IPBench评估基准,构建含20个任务、10374个双语数据点的基准,评估17个主流模型,揭示现有模型在IP任务中局限。

深度学习自然语言处理
新闻资讯8

刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。

InfoQ
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度

在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。

量子位
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
开源动态8

开源屠刀!400美元炼成「代码副脑」,硅谷天价模型成废铁

AI2开源Open Coding Agents,以最低数百美元算力成本,能训练贴合私有代码库的专属编程智能体。SERA-32B表现惊艳,其软验证生成技术降低成本,新代码易部署且兼容Claude Code。

新智元