自我奖励训练」共找到 2496 篇相关文章

算法论文8

谢赛宁团队新作:不用提示词精准实现3D画面控制

谢赛宁团队新发布的Blender Fusion框架,结合图形工具 (Blender) 与扩散模型,让视觉合成不再仅依赖文本提示,实现精准画面控制。其核心是对现有技术高效组合,还透露两项训练技巧提升泛化性。

量子位
开源动态8

智元机器人发布并开源首个机器人动作序列驱动的世界模型

智元机器人发布并开源全球首个基于机器人动作序列驱动的具身世界模型 EVAC 及具身世界模型评测基准 EWMBench,构建全新开发范式,解决具身智能演进制约,提升策略模型筛选与训练效率。

InfoQ
算法论文8

华为 IJCAI 2026 论文盘点:从「规模密度」转向「设计密度」

IJCAI 2026将召开,AI算力成本高,参数扩张边际收益低,技术创新逻辑转向‘用得更省’。华为四篇被收录论文,用精巧架构和训练策略,在四方向展现系统化工程能力,提供技术转型路径。

AI科技评论
开源动态8

Paddle OCR走到了尽头,Unlimited OCR一次读40 页

百度开源的Unlimited OCR把解码器里全部attention层换成R - SWA,模型只记128个token,能一次性读完40页文档。相比DeepSeek OCR,它在精度、速度上表现更优,训练成本低,适用范围广。

CourseAI
新闻资讯8

龙虾让位!硅谷顶流AI「爱马仕」一夜闯进微信,冲上全球第一

硅谷新宠Hermes Agent爆火,GitHub揽6.6万星,原生接入微信引开发者关注。其署名的首篇‘顶会级’论文提出Autoreason推理方法,指出传统‘自我优化’弊端,展示出小模型逆袭等优势。

新智元
新闻资讯8

OpenAI推出GPT-5.4 mini/nano;MiniMax发布M2.7;小米发布MiMo-V2系列模型

OpenAI、MiniMax、小米陆续发布新模型。OpenAI推GPT - 5.4 mini与nano,优化速度和成本;MiniMax的M2.7能自我演化;小米MiMo - V2系列覆盖智能体核心、全模态理解和情感语音合成。

AIGC开放社区
新闻资讯7

挺搞笑,MiniMax模型就是不认识「马嘉祺」

网友发现 MiniMax 模型不认识「马嘉祺」,不同接口和平台均能稳定复现。这或因训练数据清洗和分布问题,使特定词汇生成异常。论文指出 tokenizer 机制缺陷或致模型异常,问题不会随参数规模增大消失。

机器之心
算法论文8

首个测试时共进化合成框架TTCS:在「左右互搏」中突破推理瓶颈

厦门大学DeepLIT课题组提出全新测试时课程合成框架TTCS,不依赖外部标注,通过生成器与求解器共进化博弈合成课程数据,解决测试样本过难导致的训练坍塌问题,实验显示其推理能力提升显著。

机器之心
开源动态7

智普入局OCR! GLM-OCR 0.9B 也杀进来了~

OCR是上古任务,如今大模型纷纷入局,用1B以下小参数模型搅动解析市场。GLM-OCR能做文本识别等,采用三级架构,有两阶段流水线及训练机制创新,在多场景表现出色。

CourseAI
开源动态8

VinciCoder:多模态统一代码生成框架和视觉反馈强化学习,数据代码模型权重已开源

中科院与美团团队推出 VinciCoder,打破多模态代码生成中 SFT 范式瓶颈。它将奖励机制转向视觉域,通过两阶段策略统一多样化代码生成任务,在多基准测试中表现卓越,为领域研究提供新范式。

机器之心