模型评测」共找到 7898 篇相关文章

7

别让故障复盘流于形式:用AI挖掘每一次“跌倒”的价值

文章指出传统故障复盘存在诸多问题,借助AI能力可解决专业性和深度问题。介绍了智能复盘Agent,包括其核心使命、目标用户、核心价值和解决方案,还阐述了核心技术架构、实现方式及评测机制等,最后给出实战案例。

阿里云开发者
新闻资讯7

o3-pro答高难题文字游戏引围观,OpenAI前员工讽刺苹果:这都不叫推理那什么叫推理

OpenAI“最新最强版”推理模型o3 - pro引发关注。首位全职提示工程师给它设难题,它推理后答对。OpenAI前员工借此讽刺苹果。各大评测榜单显示其表现与官方有差异,苹果&SpaceX前工程师分享使用心得,肯定其表现。

量子位
算法论文7

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。

AI科技评论
推荐文章8

你不知道的 Agent:原理、架构与工程实践

文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。

阿里云开发者
算法论文8

NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了

大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。

机器之心
新闻资讯9

Claude有意识了?科学家首次挖出关键拼图,还能伸手改它的念头

本文报道Anthropic最新研究,团队在Claude大模型中发现自发形成的J-space区域,匹配意识研究的全局工作空间理论,人类可直接读取、修改AI未输出的内部想法,揭示了现有AI对齐评测的重大漏洞,为AI意识研究提供了工程化路径。

新智元
产品应用8

Meta「分割一切」进入3D时代!图像分割结果直出3D,有遮挡也能复原

Meta MSL实验室发布三维重建模型SAM 3D,其家族的两个新模型能将2D图像转为3D重建模型,性能优异。同时,此前投稿ICLR 2026的SAM 3也亮相,可克服传统模型局限,在多项任务中刷新SOTA。

量子位
产品应用8

MoE推理「王炸」组合:昇腾×盘古让推理性能狂飙6-8倍

在通往AGI进程中,MoE模型成大模型推理提效关键。华为推出Pangu Pro MoE 72B模型,经多方面优化,推理性能提升6 - 8倍。还采用多种策略和算法,在昇腾不同平台展现卓越性能,为大模型落地提供支撑。

机器之心
产品应用8

阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有

阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。

AIGC开放社区
新闻资讯7

微软这支神秘的华人AI团队加入腾讯混元,曝与裁员无关|独家

WizardLM项目创建者徐灿发文称团队离开微软加入腾讯混元。混元此前发布多款AI模型,WizardLM也发布过混元模型。该团队专注高级大语言模型开发,曾成绩斐然,但也面临模型部署挑战。腾讯大力投入AI,网友对此看法不一。

AI前线