「AI评估」共找到 10069 篇相关文章

推荐文章7

从 Shopify 构建 Agent 的经验中可以学到的

Shopify 分享构建 Agent 经验,采用主流 Agentic Loop 架构。给出4条打造 AI 智能体核心建议,还指出工具控制在20个内,可用 SubAgent 分摊上下文;用人类标记结果作基准让 LLM 评估 Agent 生成结果。

宝玉AI
算法论文8

解放军总医院联合南大、吉大等机构,共同提出首个「脊柱诊疗大模型」SpineGPT

解放军总医院联合多机构研发首个脊柱诊疗大模型 SpineGPT。研究指出通用 LVLM 有‘认知鸿沟’,团队构建 SpineMed 生态系统,含 SpineMed - 450K 数据集与 SpineBench 评估基准,SpineGPT 表现超越开源模型。

机器之心
产品应用7

Jina官方MCP三板斧:搜、读、筛

Jina官方发布MCP服务器,将核心能力封装成LLM工具集。介绍工具功能、连接使用方法,给出问题排查方案,通过案例展示搭建工作流效果,评估不同模型,指出Agent瓶颈及MCP开放生态价值。

Jina AI
推荐文章7

2026跳槽暴富指南:这些公司的期权,可能比你的年薪值钱10倍

2026年为中国科技公司IPO大年,众多公司上市后员工获丰厚收益。文章列举小红书、月之暗面等公司,分析其期权价值与上市可能性,给出评估期权的框架及投资风险提醒。

AI Reading Hub
推荐文章7

Notion Custom Agents复盘:三年重写5次,Notion 历史上最成功的新功能之一

Notion 的 AI 工程负责人 Sarah Sachs 和技术负责人 Simon Last 在采访中分享 Agent 探索思考。Custom Agents 是 Notion 历史上转化率高的新功能,开发三年重写 5 次。他们还谈及产品路线、模型评估、技术方向等内容。

Founder Park
开源动态8

超20万个高质量Skills!浙大等联合推出SkillNet,告别孤立Skill实现自进化

浙江大学联合多家机构推出开源基础设施SkillNet,拥有超20万个高质量Skills。它能让AI智能体告别失忆式工作,将互联网资源和人类经验转化为可执行Skills,构建Skills网络,经严苛评测,在真实场景验证了强大实战能力。

AIGC开放社区
开源动态8

本地运行、支持视觉与工具调用:Meta 开源智能体模型

Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经多项优化,在基准评估中表现出色,还支持多种框架。

AI前线
新闻资讯7

The Batch:836 | 基准测试成本攀升

独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。

DeeplearningAI
推荐文章8

翁荔新博客提出「自进化先从Harness开始」,DeepSeek崔添翼转发附议

前OpenAI安全副总裁翁荔新博客探讨AI自进化,提出从Harness开始的现实路径。DeepSeek崔添翼转发附议,认为Harness方向自进化很可能出成果。翁荔梳理研究,展示优化递进趋势,也指出实现递归自我改进存在的瓶颈。

量子位
算法论文8

腾讯混元数字人团队发布Moral RolePlay基准,揭秘大模型的「道德困境」

腾讯混元数字人团队和中山大学推出「Moral RolePlay」测评基准,评估大模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。

机器之心