评测机制」共找到 1466 篇相关文章

算法论文7

一文解读 LLM Posting-Train技术

文章解读了大语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者
新闻资讯8

刚刚,DeepMind通用科学智能体AlphaEvolve突破数学极限,陶哲轩合作参与

DeepMind发布革命性进化编码智能体AlphaEvolve,由LLMs驱动,可演化代码库、发现和优化算法。它结合LLM创造力与自动化评估,减少幻觉,在多领域应用前景大,还与陶哲轩合作探索数学应用。

机器之心
算法论文8

「推理革命」爆发100天:DeepSeek-R1复现研究全揭秘!

本文深入梳理围绕DeepSeek-R1的复现研究,解析监督微调、强化学习等关键技术细节,介绍相关数据集、训练方法及奖励机制等,还探讨了推理语言模型更多发展方向,为研究提供基础。

新智元
算法论文8

T-RO综述重构Foundation Model时代机器人操作知识版图

近日,论文《Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives》被IEEE Transactions on Robotics接收,它以High - Level Planning和Low - Level Action Modeling为主线,梳理Foundation Model时代机器人操作发展,分析了现存问题及关键缺口。

机器之心
新闻资讯8

OpenAI Astra发布在即,全自动网络攻防能力已突破天际!

OpenAI即将发布的模型Astra,在内部评测中获ExploitBench满分,还发现两个零日漏洞。它能力远超上一代GPT - 5.6 Sol且更听话。不过为安全考虑,OpenAI部署监控,还放慢其研究速度。

新智元
算法论文8

一篇Self-Evolving Coding Agents最新综述

当今编码智能体部署后大多静止,自进化编码智能体应运而生,可让Agent通过交互更新自身。文章介绍了其概念、分类,探讨组件进化机制、时机及评估方法,也提及带来的新挑战。

PaperAgent
开源动态8

kimi K3超大杯升级背后的技术内幕

文章介绍开源模型 K3 架构设计思路。主要探讨 MoE 和 MLA 部分,在 MoE 方面提出 SiTU、Norm、QB 改进;在注意力机制选择 MLA,与 KDA 混合缓解部分问题,还谈及 DSV4、NoPE 相关特点。

Agent的潜意识
算法论文8

横扫八大数学竞赛:清华微软联合提出STAR-PólyaMath,Apex基准超GPT-5.5 13.5%

清华大学与微软亚洲研究院团队提出推理多智能体系统 STAR - PólyaMath,构建探索 - 推理 - 验证框架,解决大模型长程数学推理瓶颈,在八大数学竞赛基准获最优成绩,还可泛化到其他推理场景。

机器之心
开源动态8

阿里重磅开源!Open Code Review:一周 5k star,为你的代码保驾护航

阿里开源 Open Code Review,它前身是内部 AI 代码评审助手,经大规模验证。该工具结合确定性工程与 Agent,解决通用 Agent 评审代码的问题,在准确率、效率等方面表现出色,还介绍了使用方法和评估方式。

阿里云开发者
产品应用7

一文搞懂如何在Codex中使用goals

OpenAI文章介绍Codex中Goals的使用,包括定义、使用方法、与普通prompt区别、编写要点、激活后变化、内部设计等,还给出复现论文示例,指出适用与不适用场景,称其改变Codex运作模式。

AI寒武纪