类R1训练」共找到 2526 篇相关文章

开源动态8

阿里开源电影级AI视频模型!MoE架构,5B版本消费级显卡可跑

阿里开源新一代视频生成模型通义万相Wan2.2,含文生视频等功能。它率先将MoE架构用于视频生成扩散模型,5B版本可在消费级显卡部署。对比前代和Sora表现更优,还推出电影级美学控制系统。

量子位
推荐文章7

普通程序员怎样转到AI方向拿到更好的offer

在AI研究员拿天价offer的当下,探讨普通程序员转AI方向拿更好offer的方法,还介绍了AI生态的五个层次,包括各层岗位、年薪及容量。

王喆的机器学习笔记
算法论文8

抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅

视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多任务中显著提升性能,实现范式跃迁。

深度学习自然语言处理
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度

在多模态大语言模型应用多元的当下,对模型理解人意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。

量子位
产品应用8

Agent 成大厂新“战场”?从同程旅行 DeepTrip 看垂 Agent 的设计与落地实践

文章聚焦同程旅行推出的垂旅行 Agent DeepTrip,介绍其设计与落地实践。它能降低旅行决策成本,构建旅行服务生态。团队基于多方面考量选 Agent 架构,还从多维度介绍实现方法及未来规划。

InfoQ
算法论文8

复旦提出自适应Reasoning方法ARM,“能屈能伸”

复旦提出自适应Reasoning方法ARM,解决LLM‘过思考’问题。ARM内置四种解题策略和三种决策模式,还搭配Ada - GRPO算法,在23个数据集测试中表现出色,省token、提速度且准确率高。

深度学习自然语言处理
推荐文章9

想给产品加一个 AI 搜索,是上向量数据库还是用 MongoDB 就够了?

本文解答产品添加AI搜索时,选用专用向量数据库还是MongoDB的选型疑问,理清两检索的能力边界,讲解MongoDB检索的架构、用法与踩坑点,给出可复用的选型判断框架。

AI Reading Hub
算法论文8

让代码接管世界演化,西湖大学发布Code视频世界模型

西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。

机器之心
新闻资讯8

刚刚,GPT-6代号再泄露!或将周四见

据传GPT - 6本周将发布,OpenAI「义父」爆料Codex接入最强Astra模型,其内部代号「mewfour」泄露。Astra内部版已解决多个数学难题,成本仅约2000美元,还或达网络安全最高能力阈值,可能开启多智能体原生时代。

新智元
算法论文8

因果发现进入基础模型时代:CDFM 如何从数据中推断因果结构 | GAIR Paper 120

因果发现正从“手工挑选算法”走向“大模型统一零样本推断”范式。广东工业大学等团队提出CDFM,能统一处理多种情况,解决传统方法痛点,在多方面展现良好性能,是因果发现基础模型时代的重要起步。

AI科技评论