训练评估体系」共找到 3204 篇相关文章

开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
开源动态8

阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源

阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。

量子位
开源动态7

国产 AI 昇腾推理不再高门槛?开源技术栈推理性能对比解析

文章聚焦昇腾 NPU 大模型推理,对比 MindIE 和 vLLM Ascend 推理性能。因 MindIE 使用门槛高,昇腾联合 vLLM 社区推出插件。实验用 GPUStack 平台,结果显示二者在不同场景各有优势,呼吁构建国产 AI 基础设施体系

PaperAgent
产品应用8

机器人学会「眼看手摸」!FreeTacMan 实现人类指尖亲自「授课」

OpenDriveLab提出的FreeTacMan,将人类视觉、触觉和动作技能高效传输给机器,破解精细操作难题。它配备高分辨率触觉“皮肤”,实现人类“手把手”教机器人“感知”,还通过融合时间感知的触觉预训练,提升机器人策略性能。

AI科技评论
算法论文8

让代码接管世界演化,西湖大学发布Code视频世界模型

西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。

机器之心
推荐文章7

强化学习 AI 系统的设计实现及未来发展

本文是阿里巴巴算法专家曹宇在 AICon 2025 北京站的分享,结合算法实践展示 RL 系统现状及发展脉络,探讨未来超大规模 RL 发展方向,涉及理论基础、业界实践、开源生态及社区共建。

AI前线
开源动态8

【万字长文】大模型开源开发全景与趋势解读

本文以蚂蚁开源团队视角,基于OpenDigger数据,分析大模型开源开发生态。呈现2025年全景图,涵盖135项目。指出训练、推理、应用侧主导领域,还探讨生态趋势、项目兴衰及近期厂商动态。

InfoQ
产品应用7

15岁进少年班,97后打造「元点机器人宇宙」:全栈技术自研领跑家庭机器人赛道

元点Zeroth发布全尺寸人形Jupiter和异构机械臂家庭协作机器人N1,强调与人类长期共生关系。其创始人是97年的郭人杰,公司已累计融10亿。元点有全栈技术体系,走渐进式落地路线。

新智元
新闻资讯8

刚刚,Anthropic官方Cluade 5使用指南发布

Anthropic发布Claude 5的Context Engineering官方指南,指出为Claude Opus 5和Claude Fable 5删掉Claude Code超80%的system prompt,在编码评估上无明显损失。还揭示6组范式反转及四类上下文载体新分工。

PaperAgent
推荐文章8

Agent 开发范式演进:从环境工程出发,“简化”多源实时上下文

本文整理自阿里云沈林在2026中国生成式AI大会分享。探讨企业级Agent落地瓶颈,指出关键在上下文供给能力,围绕信息完备性等五维度,介绍EventHouse如何让Agent接入业务环境,强调构建上下文体系重要性。

阿里云开发者