「评估工具」共找到 2519 篇相关文章
首个GUI多模态大模型智能体可信评测框架+基准:MLA-Trust
MLA-Trust 是首个针对 GUI 环境下多模态大模型智能体的可信度评测框架,构建了涵盖四核心维度的评估体系,对 13 个模型深度评估,揭示可信度风险,还提供评估工具箱,推动其可靠部署。
Claude Code 豪气收购一家0收入前端公司:押注一位高中辍学创始人
当地时间12月2日,Anthropic宣布收购热门开发者工具初创公司Bun。此次收购标志其向开发者工具领域迈进,因Bun能解决智能体分发和运行效率问题,且被众多AI编程工具使用。
全球首个多智能体Eigent开源!内置200+MCP,支持SSO企业级
OWL团队开源多智能体Manus类工具Eigent,能多智能体协作处理复杂任务。它可整合工具和数据,处理任务时清晰拆解执行。有多种预定义智能体,内置200+MCP工具,还支持人工干预。
OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临
OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。
Claude Code 的"懒加载"更新:AI 终于学会了"随叫随到"
Claude Code推出Tool Search功能,解决AI工具生态困境。它采用“懒加载”,按需调用工具,节省大量token。这反映AI工具生态从“能用就行”走向“精打细算”,对用户和开发者均有益。
MCP上下文爆炸怎么办?Anthropic给出了新答案(图文示例)
文章结合Anthropic和Cloudflare关于MCP的文章,指出MCP上下文过长存在工具定义预加载和数据反复流经AI两个核心问题,提出让AI写代码调用工具的解决方案,包括按需加载工具和代码在沙箱执行。
一篇19种自进化Agent Skill框架最新综述
这篇来自Rutgers大学和UNC Charlotte的survey,首次系统梳理Agent技能的进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。
从组件到系统,Agent 的 Evaluation 怎么做?
Agentic AI 兴起使 Agent Evaluation 成热点。评估 Agent 与 LLM 有本质区别,Agent Evaluation 要考察系统在动态环境实现目标的综合表现,传统 LLM 评估方法无法沿用。业界涌现 GAIA 等相关工作,评估范式也在不断演进。
反常识!GPT-5和Opus 4同时翻车:AI越强,越不爱用工具?
作者用GPT - 5和Claude Opus 4做进化实验,让其开发工具。两模型表现出色,但面对实际任务却不用自制工具。原因包括模型规模使脚手架工作无价值、RLHF带来工具厌恶、逼近AGI渐近线等。
大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘
为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。