测试方法」共找到 3049 篇相关文章

新闻资讯8

Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆

Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。

量子位
新闻资讯7

4倍速吊打Cursor新模型!英伟达数千GB200堆出的SWE-1.5,圆了Devin的梦!实测被曝性能“滑铁卢”?

Cognition推出全新AI编码模型SWE-1.5,专为软件工程任务设计,运行速度快,在基准测试中成绩良好。它基于GB200芯片训练,有定制编码环境,开发有新战略,还与Cursor新模型Composer对比引发关注。

InfoQ
开源动态8

中科院联合清华等发布视觉语言行动推理模型VLA-R1,让机器人先思考再行动

中科院自动化所、清华和GigaAI联合发布视觉 - 语言 - 行动模型VLA - R1,让机器人先思考再行动。它通过构建数据集教模型思维链,结合监督微调与强化学习提升性能,经多场景测试表现出色。

AIGC开放社区
开源动态8

谷歌痛失王座?港科大贾佳亚团队DreamOmni2开源,超强P图暴击Nano Banana

港科大贾佳亚团队开源DreamOmni2,该模型基于FLUX Kontext,能处理多参考图像,在多模态编辑与生成上表现出色,超越谷歌Nano Banana等模型,还构建了新测试集与数据构建范式。

新智元
算法论文7

苹果港大终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!

苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。

新智元
算法论文7

无需人类插手!AI战队自主进化,人类玩家瑟瑟发抖

论文《Agents of Change: Self - Evolving LLM Agents for Strategic Planning》以桌游《卡坦岛》为“考场”测试AI战略能力。研究团队设计四代AI特工,实验显示能自我进化的AI完爆静态AI,不过也存在计算成本高、依赖基础模型等问题。

深度学习自然语言处理
新闻资讯8

GPT-5.5全球首破!0源码盲写程序,编程AI进入新纪元

全网AI交白卷的ProgramBench编程基准,被GPT-5.5首破。它能0源码盲写程序,同一题用C和Python两种解法通过测试。相比之下,Opus 4.7表现不佳。这揭示推理算力成编程AI核心变量。

新智元
算法论文8

稳定训练、数据高效,清华大学提出「流策略」强化学习新方法SAC Flow

本文介绍清华大学和CMU提出的SAC Flow新方案,可端到端优化流策略。它将流策略视作residual RNN,用GRU和Transformer结构稳定训练。在多环境测试中表现优,有稳定、快速、样本效率高的特点。

机器之心
算法论文8

缺数据也能拿SOTA?清华&上海AI Lab破解机器人RL两大瓶颈

现有机器人视觉 - 语言 - 动作(VLA)模型训练范式存在数据采集成本高、泛化能力不足等问题。清华和上海AI Lab团队提出SimpleVLA-RL,解决了VLA模型训练的核心瓶颈,在多基准测试中实现SoTA性能。

量子位
算法论文8

dLLM的「Free Lunch」!浙大&蚂蚁利用中间结果显著提升扩散语言模型

近年来,扩散大语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对后错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。

机器之心