「小样本学习」共找到 2436 篇相关文章
突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!
近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。
全球百万网友迷上赛博「养鱼」,我也被这群AI小丑鱼拿捏了
Draw A Fish是一款AI小游戏,让全球百万网友上头。玩法简单,在画布画鱼,达到一定相似度就能放虚拟鱼缸。它门槛低、有成就感和互动性,背后是基于PyTorch的卷积神经网络,用ResNet18架构和QuickDraw数据集训练。
DiT在数学和形式上是错的?谢赛宁回应:不要在脑子里做科学
X上有博主称DiT存在架构缺陷,其FID过早稳定,可能无法继续从数据中学习。还批判了DiT的设计,如使用后层归一化和adaLN - zero。DiT作者谢赛宁回应,强调做研究要基于实验,也指出DiT现存一些问题。
AI 眼镜“秒变”直男程序员“脱单神器”,首次亮相被抢购一空!CEO 坦言:好产品要么能帮用户赚钱,要么能解决实际痛点
拂曦科技CEO段然分享AI眼镜创业经历。AI眼镜行业发展有趋势也有瓶颈,拂曦科技从B端转C端,其恋爱眼镜首秀被抢空。还谈到技术挑战、市场教育及未来爆款场景,强调场景是核心竞争力。
解决扩散模型过拟合的创新框架T-LoRA
预训练大型文本到图像扩散模型定制化时,样本有限易致过拟合。AIRI和HSE大学团队提出T - LoRA框架,动态调整训练能力、用正交初始化,实验显示其在单图像和多图像任务表现优,用户更偏好其生成图像。
RL后训练步入超节点时代!华为黑科技榨干算力,一张卡干俩活
在大模型竞赛白热化当下,强化学习后训练成突破LLM性能天花板核心路径,但算力浪费和集群效率低是难题。华为团队祭出两大黑科技破局,在超节点实现训推共卡,资源利用率翻倍,还提升训练速度。
UC伯克利新作颠覆认知:LLM靠「自信爆表」学会推理?无需外部奖励超进化
UC伯克利华人团队发现,LLM不靠外部奖励,仅靠「自信爆棚」就能学会复杂推理。他们提出基于内部反馈的强化学习(RLIF)新范式,用INTUITOR方法让模型用自身置信度作内在奖励,在多任务中表现良好。
MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench
MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。
干货超标!腾讯混元3D负责人郭春超:真正的3D AIGC革命,还没开始!
腾讯混元团队推出开源项目 Hunyuan 3D 成焦点。腾讯混元 3D 负责人郭春超在 2025 全球机器学习技术大会上表示,真正的 3D AIGC 革命还未开始,分享了 3D 生成现状、挑战及未来等核心洞察。
GPT-4o图像生成的「核燃料」找到了!万字长文拆解潜在变量,网友:原来AI在另一个维度作画
上月,GPT - 4o图像生成功能爆火。Sander Dielman在博客中探讨生成模型利用潜在空间提高效率和质量,将潜在变量比作「数据精髓」,深入对比多种模型,还介绍训练方法、损失函数等,兼具理论深度与直观洞察。