混合训练框架」共找到 3570 篇相关文章

算法论文7

LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?

论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。

深度学习自然语言处理
算法论文9

ECCV 2026|不靠「上帝视角」,也不等「完美指令」:REAL 让具身智能体走向开放世界

上海交大与上海AI实验室团队的研究,针对当前具身智能依赖理想化环境与指令假设的痛点,提出REAL框架,统一主动探索、意图消歧与执行为闭环,支持零样本迁移至真机,已开源代码并被ECCV 2026接收。

机器之心
开源动态8

万亿级思考模型,蚂蚁首次开源!20万亿token搅局开源AI

10月14日蚂蚁集团发布万亿参数思考模型Ring-1T,在多领域表现出色,推理能力直逼闭源巨头。此前已开源旗舰通用大模型Ling-1T。还介绍了训练技术创新,虽模型有不足,但开源夺冠证明‘思考力’可工程化。

新智元
开源动态8

DeepDiver-V2来了,华为最新开源原生多智能体系统,“团战”深度研究效果惊人

华为发布DeepDiver-V2原生多智能体系统,采用“团队作战”模式,在复杂知识问答和长文报告生成上表现出色。它以Planner为中心协调多个Executor,有智能任务分解等优势,训练也有新机制,昇腾NPU集群加速。

量子位
7

华为盘古大模型:被芯片牵制的“千古”模型

华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。

Agent的潜意识
算法论文8

港大×复旦×上交:视触觉融合+闭环纠错,让机器人双臂协作不再「盲操」

港大联合复旦、上交大提出TAMEn,在UMI框架上全方位升级,构建视触感知融合等数据闭环,打通数据采集到再训练链路。其三层闭环让机器人学得更快准高效,在双臂协作任务中提升成功率。

量子位
推荐文章8

Openai-o3 做不到的事,7B 模型做到了! 推荐系统“慢思考”,广告收入暴涨 4.1%

随着GPT - 4等大语言模型兴起,LLM用于推荐系统遇瓶颈,当前方法停在‘System - 1思维’阶段。A4ec框架把LLM从‘快思考’升级到‘慢思考’,用7B模型实现推荐系统升级,使广告收入暴涨4.1%。

CourseAI
新闻资讯7

警惕全球“最大”芯片IPO的暴雷风险

Cerebras 5月14日上市成2026年迄今全球最大IPO。其核心产品WSE工程有突破,但良率计算方式与传统不同。训练未成功,推理找到新机会。与OpenAI超200亿美元合同背后是股权换订单,财务数据也有隐忧,上市后存诸多疑问。

芯师爷
新闻资讯8

Codex负责人打脸Cursor CEO“规范驱动开发论”!18天造Sora爆款,靠智能体24小时不停跑,曝OpenAI狂飙内幕

本文围绕OpenAI的编程智能体Codex展开,介绍其用户增长、技术突破、应用场景等情况。Codex负责人认为真正的智能体由模型、API和框架构成,它让Sora安卓应用快速上线。还谈及OpenAI文化、AI未来及对工程行业的影响。

AI前线
开源动态8

腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实

腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。

AIGC开放社区