多步聚合训练」共找到 5661 篇相关文章

开源动态8

出自小米的模块化图像编辑改造:让 AI 学会「搭积木」

小米研究团队发布 Lego-Edit 图片编辑框架,将复杂编辑任务拆成工具集和调度系统,工具集模型各司其职,调度系统指挥操作。采用渐进式训练,性能优、扩展性好,体现协同智能优势。

AGI Hunt
算法论文8

让AI学着“看菜下碟”!港中大等新框架让推理长度减少90%,准确率反增17%

香港中文大学等研究者提出TON选择性推理框架,使视觉语言模型能自主判断是否推理。该框架有两阶段训练机制,实验显示其让推理长度最减90%,准确率还提升,有益模型部署。

量子位
算法论文8

CVPR 2026|清华联合美团推出3DThinker,首个用3D意象思考的工作

当前模态大模型在空间理解任务表现弱,缺乏对几何信息提取能力。清华联合美团推出3DThinker,无需3D标注和外部工具,让模型内蕴‘想象’三维场景,在基准上提升效果,且具备一定可解释性。

机器之心
开源动态8

刚刚,字节开源Seed-OSS-36B模型,512k上下文

深夜,字节跳动Seed团队开源Seed-OSS系列模型,含三个版本。其用12万亿tokens训练,在基准测试表现出色。有灵活推理预算控制等特性,原生支持512K上下文窗口,基准测试成绩佳。

机器之心
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
推荐文章7

Learn to Reason _ The way of Baichuan-M1-ClinicReasoning

前百川智能研究小组负责人阎栋分享大语言模型临床推理。回顾推理技术发展,以Deepseek为例;介绍百川在医疗推理实践,模型达三甲主治水平;还谈及大模型训练困境及与人类智能差异。

InfoQ
开源动态8

The Batch: 855 | 为智能体而生

总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列大语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在基准测试领先,支持工具调用,家服务商已集成。

DeeplearningAI
开源动态7

阿里最新开源王炸Agent!性能全面SOTA!

阿里WebAgent更新频繁,基本一月一版。它是类似DeepResearch的通用智能体,历经WebWalker到WebWatcher阶段演进,各阶段解决不同问题,如网页导航、自主信息搜集等,还不断优化训练数据生成与处理方式。

探索AGI
开源动态8

香港中科院发布聆音大模型,400万张图喂出个“AI超声神医”

中国科学院香港创新研究院发布超声大模型“聆音”,用超400万张图像的超声数据集,经自监督学习训练。它在项诊断任务破纪录,临床效果佳,还将模型等开源,有望推动领域发展。

AIGC开放社区
产品应用8

抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10

传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及模态联合训练方向。

InfoQ