「评分器」共找到 298 篇相关文章
如何判断 AI 将优先自动化哪些任务?
思考AI优先自动化哪些任务,可从‘描述 - 执行鸿沟’视角出发。‘描述 - 执行鸿沟’大的任务是自动化沃土,反之自动化价值有限且创建训练数据难,它与‘判别器 - 生成器鸿沟’相似又不同。
文本分类重大创新:持续学习新增类别,不会灾难遗忘
在生成环境中,传统文本分类方法新增业务标签需从头训练,易致知识灾难性遗忘。今天介绍的自适应分类器,通过四项创新,可实现动态类添加和持续学习,而不会发生灾难性遗忘。
基于阿里云 AgentLoop 的 DeepSeek Harness 评测实践
本文分享基于阿里云 AgentLoop 平台的 DeepSeek Harness 评测实践。介绍了 DeepSeek Harness 工程架构,阐述 AgentLoop 平台接入方式及价值,还详述评估器设计思路、展示评测结果,最后总结方法论并展望后续工作。
港大赵恒爽团队论文:让扩散模型既拿高分又不「作弊」丨CVPR 2026
扩散模型虽能生成逼真图像,但存在“奖励作弊”问题。港大赵恒爽团队提出 GDRO 后训练方法,引入组级奖励优化机制,提升模型表现、缓解作弊,还提高训练效率,有明显工程价值。
刚刚,加入腾讯的姚顺雨发表首篇Paper~
腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。
AMS | 西工大向锦鹏、宋述芳等:一种用于伴随方程求解的物理约束图神经网络
伴随方法用于高维优化问题,但求解伴随方程代价大。本文提出物理约束图神经网络(ADJ - PCGN),构建流场解与伴随向量映射模型,有精度和泛化性,能加速优化,方便嫁接求解器。
刚刚,马斯克开源基于 Grok 的 X 推荐算法!专家:ROI 过低,其它平台不一定跟
马斯克时隔近三年再次开源X推荐算法,该算法基于Grok,采用端到端学习预测用户兴趣。不过有争议认为这或是因现实压力。专家称其ROI低,其他平台不一定跟进,且此次开源对学术研究价值不大。
告别「一条路走到黑」:通过自我纠错,打造更聪明的Search Agent
为解决知识实时性和推理复杂性挑战,搜索智能体(Search Agent)应运而生,但缺乏自我纠错能力。腾讯联合清华提出 ReSeek 框架,引入动态自我修正机制,还构建 FictionalHot 数据集评估,实验效果良好。
阿里自己上场,用Qwen3做起了SmartResume应用
近期,阿里用Qwen3-0.6B+YOLOv10做了智能简历解析系统SmartResume,Code、Model、Paper都已开源。该系统支持多种文档格式,融合OCR与PDF元数据完成文本提取,结合版面检测重建阅读顺序,并通过LLM将内容转换为结构化字段。
用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率大幅提升
扩散大语言模型发展迅猛,或成下一代大语言模型基础范式有力竞争者。复旦大学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。