非推理任务」共找到 4068 篇相关文章

开源动态8

Qwen3家族训练秘籍公开:思考/思考融进一个模型,大模型蒸馏带动小模型

Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与思考模式,训练分多阶段,Qwen Chat还全量上线深度研究功能。

量子位
算法论文8

任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B

现有Mobile/APP Agent依赖动作级奖励,难应对变化环境。淘天集团团队提出Mobile-R1框架,采用三阶段训练,结合任务级奖励,实验显示其表现超基准,团队还计划开源资源。

量子位
新闻资讯7

刚刚!Sam Altman官宣:Plus用户GPT-5推理提至每周3000次,AI版电车难题已来

Sam Altman官宣ChatGPT Plus用户GPT - 5级推理额度提至每周3000次,还将更新UI、公布算力权衡策略。同时指出GPT - 5推出带来AI情感依恋及伦理困境,如AI成情感寄托时公司如何应对等问题。

AI寒武纪
新闻资讯7

GPT-5.6 Sol首批内测结果来了!同任务成本只有Fable 5一半

GPT-5.6 Sol预览版发布半月,首批内测报告出炉。它代码简洁,适合长链路任务,视觉效果好。虽整体略逊Fable 5,但成本近乎减半,且安全限制小,即将全量上线。

量子位
算法论文8

字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。

量子位
算法论文8

算力成本大降!马尔可夫思考机来了,LLM推理成本直接降为线性

用强化学习让LLM具备推理能力耗费颇高,计算量会二次级增长。Mila和微软研究院等团队提出马尔可夫式思考机,重构强化学习形式,让计算量呈线性,实验效果显著,还能与先进模型兼容。

机器之心
新闻资讯7

刚刚,OpenAI公司结构重大调整:继续由营利实体控制,营利性部门要变公益公司

OpenAI官方宣布公司结构重大调整,将继续由营利组织控制,现有营利部门成公益公司(PBC),营利组织控制PBC并成大股东,二者使命相同。这是与相关部门对话后决定。

量子位
开源动态7

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。

MiniMax深夜开源首个推理模型M1,其上下文能力媲美Gemini 2.5 Pro。M1在部分评测中表现中规中矩,但在MRCR(4 - needle)测试中屠榜。它得益于MiniMax - 01基座模型,应用Lightning Attention机制,开源了40K和80K两个版本。

数字生命卡兹克
新闻资讯7

高通新款云端芯片公开!借推理抢英伟达蛋糕,市值一夜暴涨197.4亿美元

高通宣布推出AI200和AI250两款全新AI芯片进军数据中心市场,消息使股价一度飙升超20%。新品聚焦推理阶段,主打低TCO、高能效与强内存处理能力,还推进端到端软件栈。高通早有布局,已获订单。

量子位
开源动态8

北大字节开源首个时空推理视频模型!思考过程全透明,性能超越GPT-4o

北大和字节联合团队推出开源模型Open-o3 Video,将显式时空证据嵌入视频推理全过程,采用non-agent架构,性能超越GPT - 4o等闭源模型。该模型构建了STGR语料体系,采用双阶段训练,实验表现优秀。

量子位