「自我奖励训练」共找到 2499 篇相关文章
科研虾LabClaw接管实验室!斯坦福和普林斯顿重新定义人机协作边界
斯坦福和普林斯顿团队构建完整AI生态,LabClaw有206个科研技能,可部署为实验室代理;LabOS结合计算与实验,能自我进化;MedOS模仿人类认知用于临床。三者协同重新定义人机协作边界。
王兴兴署名,宇树机器人春晚之后又进化了:单个策略就能学习各种极限动作
春晚上,宇树机器人展现高动态、高协同的全自主集群控制技术。现在,多机构提出 OmniXtreme 通用策略,可执行各种极限动作。该框架分两阶段,经测试在仿真和现实中表现出色,打破了泛化壁垒。
Nature子刊:攻克医疗器械「看不清」难题,赋予自动驾驶视觉
MicroSyn-X首创无需真实数据的AI合成影像技术,让机器在无标注虚拟X光中学会追踪微型手术器械,突破医疗数据稀缺瓶颈,为自动化微创手术提供新路径,且代码和数据已开源。
社区供稿丨Ring-2.5-1T,思更深,行更远
今天发布并开源万亿参数思考模型 Ring-2.5-1T,在生成效率、思考深度、长程执行上大幅提升。与其他模型对比,在高难推理和长程任务执行达开源领先。介绍架构优势、手搓案例,也提及不足与未来计划。
马斯克急了,直播回应一切!xAI全新阵容首曝光,华人联创仅剩一人
马斯克召开全员大会回应xAI高层变动,官宣合并后全新阵容。他还介绍了xAI四大核心板块,强调其发展成果,提及编程变革,宣布X平台开源等,更规划在月球建AI工厂。
如何科学地“设计”SFT 数据?一次关于 ODA 的完整平台级验证
大模型后训练阶段,SFT数据构建常依赖‘直觉’或‘试错’。上海人工智能实验室OpenDataLab团队发布报告,基于OpenDataArena提出新范式,将数据集构建从‘随机艺术’变为‘确定性工程’,并进行平台级验证。
MoltBot(Clawdbot)之父的20条AI哲学
MoltBot(Clawdbot)爆火,其开发者分享20条AI哲学,涵盖心态、学习、闭环验证等方面,指出AI改变编程体验,强调系统性思维、prompt技能等重要性,还提及对未来程序员的影响。
谷歌新模型登顶Nature,人类基因密码被解码
谷歌推出全新AI工具AlphaGenome,能精准预测人类DNA序列变异对调控基因生物过程的影响。它满足多项条件,在26个变异效应benchmark中25个达SOTA,还通过多个案例和实验验证了其性能。
字节跳动李航博士新作:AI智能体的通用框架
字节跳动李航博士在JCST发表观点论文,提出涵盖软件和硬件智能体的通用框架。该框架以完成任务为目标,依赖LLM,用强化学习构建。文章还探讨了与大脑机制关联、未来研究方向等。
“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约
当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。