自演进评测」共找到 1873 篇相关文章

新闻资讯7

老黄大出血!OpenAI背刺英伟达,微软研芯连夜拆掉CUDA护城河?

2026年1月26日微软官宣第二代研AI芯片Maia 200上线,还推出软件Triton。它塞满SRAM,推理成本更低、效率更高。这让英伟达面临生存危机,AI算力圈也变天,降本成关键。

新智元
算法论文8

何恺明首个语言模型:105M参数,不走GPT回归老路

何恺明团队推出全新连续扩散语言模型ELF,不走GPT回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。

量子位
算法论文8

顶会SOSP'25最佳论文,被一个国产研操作系统拿下

国产研开源操作系统星绽的学术论文获顶会SOSP'25最佳论文。它专注高可扩展内存管理研究,兼顾性能与安全。星绽由多单位联合研发,用Rust语言,解决传统系统难题,已有多篇论文被国际顶级学术会议录用。

InfoQ
产品应用7

全球首个跨本体、跨视角、多模态物理世界模型,CurrentWorld-0 来了!

Current Robotics 发布跨本体、多模态物理世界模型 CurrentWorld-0,它从真实数据学规律,整合跨本体、多视角和力触预测,可评测机器人,解决动作可控性等问题,让评测成训练数据入口。

机器之心
开源动态7

24张图,从GPT-2到gpt-oss,看OpenAI开源模型技术演进

2025年8月OpenAI释出gpt-oss-20b与gpt-oss-120b两个开源权重模型。文章梳理了从GPT - 2到gpt - oss的技术演进,拆解关键创新点,对比了与Qwen3的差异,介绍训练推理细节、实测体验及与GPT - 5跑分对比情况。

PaperAgent
产品应用7

Cursor研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了

Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。

量子位
算法论文8

规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰

上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 能提升规范遵循度,GPT - 5 在规范对齐上断层领先。

机器之心
产品应用8

迎接智能体的「觉醒时刻」:EverOS全球公测开启Agent Memory进化序章

随着主动执行型 Agent 爆发,AI 向我演化智能体跃迁,但现有 Agent 有诸多痛点。EverMind 团队公测专为我演化智能体设计的记忆底座 EverOS,它依托核心算法与进化引擎,提升任务成功率,解决多项技术难题。

机器之心
算法论文8

警告:你的Agent可能无法"解决"真实世界的视觉问题

文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。

深度学习自然语言处理
算法论文8

强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进

本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。

机器之心