评测环境」共找到 1070 篇相关文章

新闻资讯7

GitHub 推出 AgentHQ,Copilot 生态再扩容

GitHub在GitHub Universe 2025活动上推出AgentHQ,可让开发者在其开发环境创建并部署AI智能体,是Copilot延伸。智能体可处理编码多环节,还与GitHub Actions集成,社区反响褒贬不一。

InfoQ
推荐文章8

深入原子世界,他在寻找材料失效的原因

文章介绍了美国宾夕法尼亚州立大学副教授杨洋的材料研究。他利用先进电子显微技术,研究材料在极端环境下微观过程,如空位、虫洞腐蚀和短程有序,旨在理解材料失效机制,推动材料设计优化。

DeepTech深科技
算法论文8

给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策

上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。

深度学习自然语言处理
推荐文章7

Anthropic说:不要在等下一代模型了,立刻马上做Harness!

文章指出当前优化模型运行环境(Harness)回报率或超等下一代模型。介绍了Harness Engineering的发展,还列举OpenAI、Stripe等公司实践,也提及不同观点,强调Harness是持续演化系统。

探索AGI
开源动态7

让 AI 像真人一样操控手机完成各种复杂任务

MobiAgent是强大的移动端智能体系统,含智能体模型家族、加速框架、评测基准。能让AI像真人操控手机完成复杂任务,提供开箱即用App,内置经验检索模块可自动优化规划。

GitHubStore
算法论文8

Meta通过简单算术解锁LLM SoTA性能

大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。

深度学习自然语言处理
新闻资讯7

人形机器人不再「走走停停」:Current Robotics发布全身灵巧操作模型Curr-0

具身智能领域中,让机器人移动中精细操作一直未被很好解决。Current Robotics发布全身灵巧操作模型Curr - 0,用Single Policy统一策略,数据源于自研外骨骼系统,还构建世界模型解决评测部署难题。

机器之心
算法论文7

姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”

姚顺雨入职腾讯后首个成果CL - bench,用来测试大模型“从上下文中学习”能力。研究指出当下模型多依赖“过去”知识,无法适应“当下”学习。评测中,十个前沿模型表现不佳,揭示其真实场景应用缺陷。

量子位
算法论文7

The Batch: 896 | 教会模型说出真相

大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白机制可监控模型行为。

DeeplearningAI
产品应用8

18个月,中国Token消化狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本

中国大模型API服务碎片化、“黑盒”问题严重,成本高。清程极智1月29日发布AI Ping,类似“中国版OpenRouter + Artificial Analysis”,可评测、路由大模型,帮开发者降低成本、提升效率,还能重塑服务市场秩序。

机器之心