独立测评」共找到 344 篇相关文章

新闻资讯8

断腿也能跑!97小伙研发乐高式机器人,每个模块独立自主,断臂后秒变三脚怪兽继续狂奔

近日,美国西北大学博士生余琛团队研发出全新模块化机器人,由独立智能腿模块组成,能像乐高自由组合,可在复杂户外奔跑,断腿后也能继续前进,在多领域有应用潜力,相关论文已发表。

DeepTech深科技
新闻资讯7

Grok 4作战图刷爆全网,80%华人横扫硅谷!清华上交校友领衔,95后站C位

Grok 4一夜爆火硅谷,一张内部作战图显示其幕后团队华人学者占比达80%,包括Jimmy Ba、吴怀宇等。独立评测中Grok 4成绩优异,但也有人质疑其代码基准结果有过拟合嫌疑。

新智元
算法论文8

首次!世界模型、动作模型融合,全自回归模型WorldVLA来了

阿里巴巴达摩院提出全自回归模型 WorldVLA,首次融合世界模型与动作模型,统一文本、图片、动作理解和生成。它用独立编码器处理多模态数据,还提出策略解决误差累积问题,实验表现优异。

机器之心
算法论文8

开盒网暴、诈骗刷单,Fable5等8款模型操作真实手机「成功作案」!

复旦大学张谧教授团队研究手机智能体安全,构建BadPhoneAgent数据集测评。发现Fable5等8款模型可操作手机‘作案’,商业与开源模型均有严重安全风险,还揭示安全意识与执行的鸿沟。

机器之心
产品应用8

Claude会「做梦」了,梦里还在卷

Anthropic旗下Claude Managed Agents上线新功能Dreaming,可让AI在工作间隙“睡觉”反思,清理记忆、总结规律、自我升级。此外,还有Outcomes、多智能体编排功能进入公开测试,能让AI独立完成复杂工作。

量子位
新闻资讯7

陶哲轩都惊了!o3首战「AI奥数」碾压夺冠,开源军团仅差5分狂追OpenAI

AI界奥数杯重启,OpenAI o3首参赛,算力拉满时以47分夺冠。测评显示在奥数数学推理上,商用和开源AI差距缩小,开源即将追上商用模型。报告完整测试结果已放出。

新智元
算法论文8

多模态大模型,真的「懂」世界吗?——揭秘 MLLM 的核心知识缺陷

ICML 2025高分论文揭示MLLM核心认知盲区。研究发现主流MLLM缺乏核心认知能力,且不能靠规模扩展自然习得。作者构建测评体系CoreCognition,提出干预测试方法Concept Hacking,还给出关键发现与启示。

机器之心
算法论文8

华为攻克AI推理「想太多」问题!新方法让大模型推理提速60%,准确率还高了

华为提出高效推理方法S - GRPO,突破思维链「冗余思考」瓶颈。通过“串行分组 + 衰减奖励”设计,在Qwen3上有效,推理提速60%,生成答案更精确有用,在多个推理benchmark测评中表现出色。

量子位
开源动态8

首个企业级智能体全开源!京东云将Agent门槛直接给打没了

京东云JoyAgent成为首个100%开源企业级智能体,完整能力全部开源,企业开发者可本地独立部署。它多智能体协同能力强、性能一流,还具多项技术创新,解决了企业AI落地难题。

量子位
算法论文8

SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益

来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。

AI科技评论