「Skill训练」共找到 2466 篇相关文章
快手在 AI 上,渐入佳境
文章介绍快手多模态大模型 Keye-VL 1.5,参数 8B 适合中小企业。它侧重短视频场景,视频理解能力强,能与业务结合,提升推荐等场景效率。还详述其架构、预训练、后训练及训练架构优化等技术细节。
7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍
腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。
别错过,Clawdbot(Moltbot、OpenClaw)爆火之后,我找到啦 700+ 的技能包~~~
awesome-openclaw-skills是VoltAgent在GitHub维护的「OpenClaw Skills精选清单」,收录700+社区构建的OpenClaw技能,按场景分类,方便安装使用。还介绍了安装方法和技能分类。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
To Agent, not Human
软件开发正从面向人类转向面向Agent。作者将newtype内容生产系统CLI化,供Agent使用。当前各种工具CLI化,Skill生态爆发,技术栈含CLI、MCP、Skills、Framework四层。
端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程
南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。
世界模型开始做减法?LeCun团队和清华团队给出两种思路
近期,Yann LeCun团队的LeWorldModel用简洁JEPA实现从像素端到端训练世界模型,降复杂度且验证潜在空间物理刻画能力;清华团队的Fast - WAM探讨推理阶段显式生成未来必要性,给出高效替代路径。
告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜
DreamPRM由加州大学圣地亚哥分校团队开发,在MathVista测评榜夺冠。它通过双层优化框架解决多模态过程奖励模型训练难题,能与多模态大模型集成,提升推理能力,实验效果显著。
LeCun发布最新世界模型:首次实现16秒连贯场景预测,具身智能掌握第一视角!还打脸用了VAE
LeCun团队推出PEVA模型,让具身智能体学会人类“预判能力”,首次实现16秒连贯场景预测。它结合结构化动作表示与条件扩散Transformer,用真实数据训练,解决长时序问题,还能筛选最优动作。
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。