「DMD2算法」共找到 2406 篇相关文章
强化学习 AI 系统的设计实现及未来发展
本文是阿里巴巴算法专家曹宇在AICon 2025北京站的分享。从RLHF系统出发,结合实践展示RL系统现状与发展,探讨超大规模RL方向,涉及理论、业界实践、开源生态等,还介绍了AICon北京站活动。
Claude不让我们用!国产平替能顶上吗?
全球AI代码生成竞争格局生变,Anthropic地位动摇,一是OpenAI GPT - 5崛起,二是自身迷之操作。此时国产大模型发力,如Kimi - K2 - 0905、Qwen3 - Max - Preview,性能和价格有优势,有望改变竞争格局。
荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!
人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互型LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。
腾讯混元挖走微软明星大模型团队!一作全员出走,新成果已跻身大模型竞技场TOP 10
微软明星大模型WizardLM一作全员加入腾讯混元,最新成果Hunyuan - Turbos跻身大模型竞技场TOP 10。此前WizardLM - 2发布不顺,且微软将裁员超6000人,国内大厂正激烈争夺大模型人才。
半量工具,双倍效能:ARPO革新大模型强化学习
大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率低和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降低工具调用成本且提升多轮推理性能。
开放世界任务成功率82%!美的攻克机器人泛化控制难题
美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。
太牛了~~复杂表格Cell合并、跨页拼接,中文领域96%,甩MonkeyOCR 20%
在PDF文档解析领域,复杂表格解析是难题。今天分享的OCRFlux是基于qwen2.5vl - 3B模型微调的解决方案,有单页解析和跨页段落/表格合并等创新点,测试得分超96%,远超MonkeyOCR等。
实测updream预演台:一张图,换来一整个3D片场!
作者实测updream预演台,它可传图自动重建3D白模场景,可摆人物、调机位等,再配合Seedance 2.5渲染成片。作者还做了对照实验,证明白模能锁定拍摄意图,并给出使用建议。
全国大学生,苦 AIGC 检测久矣
央视报道,多位高校学生毕业论文被 AIGC 检测系统误判,甚至《滕王阁序》《出师表》也被标为高风险。检测原理主要依赖「AI 困惑度」和「突发性」。毕业季检测算法升级致结果大幅波动,引发学生不满。
关于 AI Agent,「实在」、「好用」可能比「颠覆」更重要
8月18日百度AI Day上,百度文库、网盘联合发布全端通用Agent「GenFlow2.0」。它无需邀请码,多专家协助,能利用文库和网盘数据,实测在多场景表现超预期,稳定高效,“好用”才是关键。