评估驱动开发」共找到 2708 篇相关文章

8

专业医生远不如AI模型?OpenAI推出医疗开源测试基准HealthBench,o3表现最强

OpenAI推出医疗开源测试基准HealthBench,由262位多国医生合作打造,含5000段真实健康对话。评估显示o3综合表现最佳,顶尖AI处理任务能力超无辅助医生,HealthBench更真实专业有区分度,但也有局限。

AI寒武纪
算法论文8

推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限

大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。

新智元
开源动态8

杨立昆亲自指导开源世界大模型,为AI Agent打造超级大脑

今天凌晨,Meta开源世界大模型V - JEPA 2,它用超大规模数据集训练,能让AI Agent理解物理世界。图灵奖得主杨立昆参与开发并推荐。模型经多方面改进,还拓展用于机器人规划和视频问答,效果良好。

AIGC开放社区
开源动态7

让你的 ClaudeCode 秒变 Openclaw(龙虾),连接飞书、Discord 远程控制

作者用Vibe Coding开发Agent客户端Codepilot,将Claude Code桌面端功能拓展,支持飞书等IM远程连接等。还开源Claude-to-IM及Claude-to-IM-skill项目,前者适合开发者接入IM远程控制,后者可让Claude Code与IM远程交互。

歸藏的AI工具箱
新闻资讯7

编程奇点逼近,程序员斩杀线就在眼前!软件版YouTube时刻在发生

新智元报道,软件开发正迎来「YouTube时刻」,AI工具如Cursor、Claude Code等让编程变简单。A16z投资人预言App创建速率或飙升10倍,软件边际成本趋近零,人人可成开发者,不过程序员也面临被AI替代风险。

新智元
新闻资讯7

DeepSeek 新模型曝光,即将发布

据彭博社消息,年初凭 R1 模型震动全球的 DeepSeek 正开发全新 AI Agent 模型,创始人推动团队在今年四季度发布。该模型能代表用户执行多步骤操作、基于过往行为学习改进,行业也在向 Agent 软件转型。

AGI Hunt
新闻资讯7

All in AI 两年,AI 代码采纳率突破 50%!安克创新龚银:AI 平台一旦过时,我们会毫不犹豫重构

安克创新2023年决定All in AI,探索适配内部运营与新的产品形态。这两年有项目放弃也有成果,如代码采纳率突破50%。其评估AI落地可行性关注业务、技术、团队成熟度,还采取差异化管理应对创新的ROI问题。

InfoQ
产品应用7

深度剖析 MCP SDK 最新版: Streamable HTTP 模式正式发布,为你实测揭秘

MCP SDK 新版本 v1.9.0 发布,新增 streamable HTTP 传输模式。本文对该模式全面剖析与实测,涵盖快速上手、核心参数、session - id 等内容,还介绍开发服务端及多应用实例模式,指出新模灵活性提升但有不足。

AI大模型应用实践
开源动态8

阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航

阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。

阿里云开发者
产品应用8

一年磨一剑,今年最炸机器人Demo来了!1亿美元种子轮团队出手,单个模型解锁单手打蛋解魔方弹钢琴

Genesis AI发布机器人基础模型GENE - 26.5,让机器人可自主完成烹饪、实验室操作等复杂任务。该团队全栈自研,从硬件、数据、模型到训练评估都有独特方案,曾获1.05亿美元种子轮。

量子位