自动评测体系」共找到 1694 篇相关文章

算法论文8

跟不上、读不完?上万篇顶会论文,这个工具一键分析

加州大学圣迭戈分校等机构开发 Real Deep Research(RDR)系统,可自动完成领域综述与趋势追踪。它从顶会收集论文,压缩成摘要并聚类,还能生成综述、绘制趋势图谱。与已有方法不同,它结合自动化与专家知识。

机器之心
开源动态8

小米开源首个跨域具身基座模型MiMo-Embodied,29个榜单SOTA

小米具身智能团队开源跨域基座模型MiMo - Embodied,它融合自动驾驶与具身智能,在29个榜单创SOTA。该模型基于MiMo - VL架构,采用四阶段训练策略,有效解决领域割裂问题,为通用VLA模型奠定基础。

机器之心
开源动态8

首发 | 陈天桥盛大团队,推出最强开源记忆系统EverMemOS

EverMind团队发布面向人工智能智能体的长期记忆操作系统EverMemOS。它在主流评测集表现超此前工作成新SOTA,受人类大脑记忆机制启发设计,有四层架构和三大特点,已开源,后续将推云服务。

机器之心
开源动态8

开源!强效果,高性能,严隐私?我全都要:OPPO 终端大模型实践

OPPO AI 中心推出开源端侧多模态大模型 AndesVL,含 0.6B - 4B 四档尺寸套件,有通用能力强等优势。它经多阶段训练,OPPO 还构建端侧部署方案,评测显示其在多方面表现优异,未来会继续技术革新。

InfoQ
算法论文8

从静态模型到数字生命体:自进化AI Agent综述

近年大型语言模型催生AI智能体发展,但现有系统依赖人工预设,难适应动态环境。论文提出自进化AI智能体,可通过环境反馈自动优化,还提出三定律、四阶段范式演进模型等,开源EvoAgentX框架。

深度学习自然语言处理
新闻资讯8

内幕曝光:OpenAI模型坦承不会第六题,3人俩月拿下IMO金牌!

OpenAI三人团队俩月让AI达IMO金牌水平。他们用多智能体系统技术,使模型能短时间解复杂问题。新模型有自省能力,减少“幻觉”问题。此次突破是通用推理技术进步,未来将整合进更多模型。

新智元
推荐文章7

从 MCP 到 Agent:构建可扩展的 AI 开发生态的工程实践

本文整理自字节跳动 Trae 架构师陈仲寅在 AICon 2025 上海的分享。探讨通过 MCP 及 Agent 构建可扩展生态体系,涵盖自定义 Agent 设计、与工具集成及共建等内容,还展望技术演进方向与 AICon 深圳站信息。

AI前线
算法论文8

ICML 2025 | 无需训练,即时对齐大模型偏好

上海人工智能实验室提出TPO方案,可让大模型在推理时快速对齐人类偏好,无需更新模型权重。TPO类似文本形式的梯度下降,在多个基准数据集评测中表现出色,还提供“宽深结合”推理拓展策略。

深度学习自然语言处理
新闻资讯7

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。

新智元
推荐文章7

深度解读|LLM Wiki 的工程实践,从 AI Coding、Obsidian 到 RAG 协同。

文章介绍 LLM Wiki 工程实践。包括为 AI Coding 创建知识地图,指导 Agent 加载上下文;在 Obsidian 构建知识体系,有插件和自定义 Agent 两种方法;还分析其与 RAG 关系,指出可融合互补,不要过度神话 LLM Wiki。

AI大模型应用实践