后训练范式」共找到 4404 篇相关文章

算法论文8

75%预训练数据都能删!Jeff Dean新作:全自动筛除低质量数据

Google DeepMind团队开发的DataRater可全自动评估数据质量,用元学习筛选有价值数据,提升模型训练效率。它能减少计算量、提高性能,在低质量数据集效果佳,还能跨模型规模泛化。

新智元
产品应用8

飞书和豆包合并的第一个Agent产品,豆包工作,它来了。

字节发布飞书与豆包整合的首个产品——豆包工作,它是完整办公 Agent,与飞书原生打通,功能丰富。对用飞书办公的公司而言,使用便捷,还便于管理 AI 额度,是很好的 Agent 起手式。

数字生命卡兹克
新闻资讯7

一家00创办的世界模型公司,凭什么让华为哈勃重金押注?

近日,00创办的魔芯科技完成Pre - A +轮近亿元融资,由华为哈勃领投。该公司从3D AI物体建模出发,研究独特技术路线,在科研和产品应用有突破,正将能力落地多领域。

机器之心
算法论文7

不平衡数据下对比学习的理论分析:从训练动态到剪枝解决方案

本文第一作者为新泽西理工学院廖海旭。对比学习在类别不平衡数据下面临挑战,此前研究未考虑其影响。本文构建理论框架刻画训练动态,定量分析少数特征影响,提出剪枝算法增强少数特征学习,实验验证其有效性。

机器之心
算法论文8

SIGGRAPH 2026 | 无需训练,一段单目视频解锁任意运镜与「子弹时间」

来自UIUC、宾大与Netflix Eyeline Labs的研究团队提出FreeOrbit4D,无需训练模型,用单目视频就能实现任意运镜和“子弹时间”。它通过“前景补全的4D重建”提供几何支架,在大角度视角变化下表现出色,还带来诸多应用。

机器之心
算法论文8

强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史

本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。

机器之心
算法论文8

90华人副教授突破30年数学猜想!结论与生成式AI直接相关

90华人数学家Yuansi Chen攻破困扰数学界30多年的塔拉格兰卷积猜想,论文精确到一个log log η因子。此研究为理解高维离散空间平滑化提供论证,与机器学习、生成式AI密切相关。

量子位
开源动态8

从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音

复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。

机器之心
开源动态8

阿里开源PromptEcho:用冻结多模态大模型为文生图训练提供高质量Reward

阿里团队提出PromptEcho方法,无需标注和训练reward模型,仅通过冻结多模态大模型(VLM)的一次前向推理获高质量reward。实验显示其在文生图和电商海报文字渲染任务效果佳,且已开源相关代码等。

机器之心
开源动态8

最鲁棒的MLLM!港科大开源「退化感知推理新范式」 | AAAI'26

多模态大语言模型(MLLMs)在真实世界视觉退化下性能崩溃,制约产业落地。港科大等团队开源的Robust - R1被AAAI 2026接收为Oral,提出显式结构化推理新范式,实现质量与鲁棒性双重突破。

新智元