训练评估体系」共找到 3215 篇相关文章

产品应用8

ChatGPT长了手脚,AI不再是副驾,直接抢过方向盘

OpenAI昨夜发布ChatGPT智能体,它整合网站交互、信息整合、对话交互三项能力,能智能选最优路径完成任务。在多项评估中表现领先,还有多重安全措施。今日向部分用户开放。

AI工程化
算法论文8

打破传统游戏逻辑!Google | 提出Concordia ,通过Mutil-Agent构建游戏引擎!

Google DeepMind和多伦多大学研究人员提出Concordia软件库,用AI驱动智能体担任GM,基于「实体 - 组件」架构,让工程师和设计师分工,可灵活构建复杂游戏场景,还支持不同交互动态和多种使用动机。

AINLPer
算法论文8

南大等8家单位,38页、400+参考文献,物理模拟器与世界模型驱动的机器人具身智能综述

当下,具身智能成研究热点。南大等8家单位学者撰写综述论文,指出物理模拟器与世界模型融合是实现具身智能的潜力路径。论文系统梳理两者协同推动机器人演进全貌,还提出分级标准等内容。

机器之心
算法论文8

快慢Reasoning综述!

大型语言模型在复杂推理任务中有‘无差别计算’缺陷,阻碍其在多场景应用。本文提出双层效率优化框架,梳理两类前沿技术,通过实验揭示瓶颈,为轻量化推理指明路径。

深度学习自然语言处理
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度

在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。

量子位
算法论文8

你的衰老速度被科学家拍出来了| Nature子刊

Nature子刊研究推出新指标DunedinPACNI,不看身份证年龄,看“脑年龄”。其数值越高,脑功能衰退风险越高。该指标已开源,或助人们检测身体状况、调整生活方式。

量子位
算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
产品应用8

Agent 成大厂新“战场”?从同程旅行 DeepTrip 看垂类 Agent 的设计与落地实践

文章聚焦同程旅行推出的垂类旅行 Agent DeepTrip,介绍其设计与落地实践。它能降低旅行决策成本,构建旅行服务生态。团队基于多方面考量选 Agent 架构,还从多维度介绍实现方法及未来规划。

InfoQ
开源动态8

MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀

MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。

AI科技大本营
开源动态8

Kimi新模型拿下代码开源SOTA,仅仅72B,发布即开源

深夜,Kimi发布新开源代码模型Kimi - Dev,在SWE - bench Verified上以60.4%成绩获开源SOTA。参数量72B,编程水平强。采用MIT协议,权重和代码已发布。官方透露了部分关键技术,更多细节待后续报告。

量子位