优化训练」共找到 3090 篇相关文章

开源动态8

让图像生成告别 AI 味!清华 + 港中大 + 腾讯混元联手推出SRPO

腾讯混元联合港中大、清华推出SRPO,解决文生图技术痛点。它结合Direct - Align和SRPO,提升图像审美等,训练时间缩至十分钟,在测试中碾压主流方法,不过对冷门风格控制和机制可解释性待提升。

AIGC开放社区
开源动态8

腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实

腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。

AIGC开放社区
算法论文8

斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4

斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。

深度学习自然语言处理
开源动态8

Jina Code Embeddings: 为高质量代码搜索而生的0.5B/1.5B向量模型

本文介绍了 Jina AI 开源的代码向量模型 `jina-code-embeddings`,含 0.5B 和 1.5B 规模,有 GGUF 量化版本。它性能顶尖,支持多任务与 15 种语言,还介绍了训练方案、使用方法等。

Jina AI
算法论文8

通义实验室最新成果WebDancer:开启自主智能Deep Research的新时代

通义实验室推出 WebDancer,解决自主信息检索智能体构建难题。它创新合成训练数据,采用两阶段训练策略应对开放网络训练挑战,在多个基准测试中表现卓越,未来还将拓展能力。

机器之心
产品应用7

Cursor Composer 2.5 拆解:最强大的 RL 环境,就是你自己的产品

今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。

Founder Park
开源动态8

SOP:具身智能在线进化新范式,为大规模真实世界部署而生

智元机器人具身研究中心提出SOP在线后训练系统,将VLA后训练重构为“在线、集群、并行”,可即插即用后训练算法。它有高效探索、缓解偏移等优势,实验显示能提升性能、效率,突破VLA瓶颈。

PaperAgent
开源动态8

开源!强效果,高性能,严隐私?我全都要:OPPO 终端大模型实践

OPPO AI 中心推出开源端侧多模态大模型 AndesVL,含 0.6B - 4B 四档尺寸套件,有通用能力强等优势。它经多阶段训练,OPPO 还构建端侧部署方案,评测显示其在多方面表现优异,未来会继续技术革新。

InfoQ
开源动态7

如何重现 DeepSeek 推理性能突破

DeepSeek-V3 是热门开源大模型,采用大规模 MoE 架构,优化推理性能是工程难点。阿里团队在 RTP - LLM 完成优化,对齐其推理系统性能,分享关键技术、不足与思考,还提及对 Qwen3 模型的优化策略。

InfoQ
算法论文8

超越RAG和DAPT!华人团队新研究引热议:即插即用、无需改变原参即可让模型化身领域专家

华人团队提出比DAPT和RAG更方便、成本更低的方法,即“Memory Decoder”预训练记忆模块。它像“领域知识插件”,即插即用、不改原参,能让Qwen、Llama等模型成领域专家,还降低困惑度。

量子位