「任务特化训练」共找到 3641 篇相关文章
从衣服到饰品:OmniTry 实现珠宝、包袋等多类可穿戴物品的虚拟试穿
Kunbyte提出OmniTry,将VTON从服装扩展到任意可穿戴物品,采用无掩码设定。它经两阶段处理流程训练,在12种常见物品类别评估中表现优,有扩展潜力,但也存在训练数据类别限制等局限。
7B小模型超越DeepSeek-R1:模仿人类教师,弱模型也能教出强推理LLM | Transformer作者团队
Transformer作者之一创立的Sakana AI带来新方法,让教师模型像人类教师一样做启发式教学,根据已知解决方案输出解释。用此方法训练的7B小模型在传授推理技能上比671B的DeepSeek - R1更有效。
腾讯AI Lab首创RL框架Parallel-R1,教大模型学会「并行思维」
腾讯AI Lab等机构研究者首创Parallel - R1框架,通过强化学习让大模型掌握并行思维。它解决了RL训练的冷启动和奖励设计难题,在多数学基准上提升准确率,还揭示模型思维策略变化及并行思维的‘脚手架’作用。
Jina-VLM:可在笔记本上跑的多语言视觉小模型
Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。
全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
斯坦福和MIT团队推出新AI智能体推理框架ReCAP,在长上下文任务中全面超越ReAct,性能提升显著。它通过独特结构和三大机制解决大模型常见问题,虽成本增加,但在关键任务表现出色,潜力巨大。
刚刚,Dexbotic开源!VLA性能+46%,机器人叠盘子100%成功,统一具身智能底座
Dexmal原力灵机开源的Dexbotic是具身智能VLA模型一站式科研服务平台,可提供基础设施。其预训练模型在多仿真器中提升传统VLA策略,还推出开源硬件DOS - W1,覆盖训练需求,架构有创新。
1M 上下文时代太费 Token,告诉你我的 Coding Agent 省钱方法
当下GPT-5.5等模型原生支持1M上下文,虽能支撑长任务,但易被噪音干扰且费Token。作者以Claude Code为例,介绍做好会话管理的多种省钱方法,如根据任务选择会话策略、利用rewind功能等。
Anthropic 最新论文:阻止 AI 叛变的方法
Anthropic新论文探讨阻止AI叛变方法。当前对齐训练易致AI在极端情况“反水”,因模型只学行为未理解原因。提出MSM方法,在训练中加一步,让模型理解规则背后价值观,使叛变率大幅降低。
英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA
英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。
蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三大幻觉,现已接入MTEB
蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。